一、项目概述:给 Agent 一条 URL,直接拿到正文
NewsCrawler 是由 NanmiCoder 开发的开源多平台新闻与内容爬虫集合。它的核心理念极简而高效:给 Agent 一条 URL,直接拿到正文、图片和元数据;不启动浏览器,不把整页 DOM 塞进上下文。
与传统新闻爬虫不同,NewsCrawler 的首要产品是可迁移的 news-extractor Agent Skill——它将 12 个主流新闻与内容平台的抓取代码打包在一个自包含目录中,让 Codex、Claude Code 或其他支持 SKILL.md 的 Agent 在本地直接提取文章,返回统一的 JSON 或 Markdown 格式。
截至 2026 年 8 月,该项目在 GitHub 上已获得 488+ Stars 和 84 Forks,并持续获得更新维护。
二、支持的平台
NewsCrawler 支持 12 个主流新闻与内容平台:
| 平台 | URL 识别示例 |
|---|---|
| 微信公众号 | mp.weixin.qq.com/s/... |
| 今日头条 | toutiao.com/article/... |
| 网易新闻 | 163.com/news/article/... |
| 搜狐新闻 | sohu.com/a/... |
| 腾讯新闻 | news.qq.com/rain/a/... |
| Lenny's Newsletter | lennysnewsletter.com/... |
| Naver Blog | *.naver.com/... |
| Detik News | news.detik.com/... |
| Quora | *.quora.com/... |
| BBC News | bbc.com/news/articles/... |
| CNN News | cnn.com/YYYY/MM/DD/... |
| Twitter/X | x.com/<user>/status/<id> |
此外,项目还提供了中国新闻站点专用 Skill(china-news-crawler),专门针对微信公众号、今日头条、网易新闻、搜狐新闻、腾讯新闻进行优化。
三、为什么选择 NewsCrawler?
3.1 核心优势
| 特性 | 说明 |
|---|---|
| 全平台覆盖 | 12 个主流平台,覆盖中、英、韩、印尼等多语种内容 |
| 智能提取 | 自动识别平台类型,提取标题、正文、图片、视频等多媒体内容 |
| 统一输出 | 所有平台输出标准化 JSON 格式,完美适配数据分析、入库、下游处理 |
| 灵活使用 | 支持 Python API(自动化)+ Web UI(可视化)+ MCP Server(AI Agent) |
| 一键部署 | Docker Compose 编排所有服务(后端 + 前端 + MCP) |
| AI智能体集成 | 支持 MCP 协议,可接入 Claude Desktop 等 AI工具 |
| 模块化设计 | 各平台爬虫解耦,易于扩展新平台或优化现有实现 |
| 轻量高效 | 使用 uv 管理依赖,安装快速,运行稳定 |
3.2 Token 效率:实测数据
NewsCrawler 最突出的价值在于大幅降低 AI Agent 处理新闻内容的 Token 消耗。2026 年 7 月 20 日,项目团队用一篇真实的 Detik News 文章做了对照测试:
| 输入给 Agent 的内容 | Token 数 | 相比完整 DOM |
|---|---|---|
| 浏览器渲染 DOM | 59,788 | 基线 |
| 浏览器无障碍快照 | 6,842 | 少 88.56% |
| 浏览器可见文本 | 1,907 | 少 96.81% |
| Skill 结构化 JSON | 1,730 | 少 97.11% |
| Skill Markdown | 633 | 少 98.94% |
结构化 JSON 从 59,788 tokens 降至 1,730 tokens,体积仅为浏览器 DOM 的 1/34.56。这意味着:
- 更低的 API 调用成本
- 更快的推理速度
- 把昂贵的模型上下文留给总结、检索、比较和判断
3.3 Agent工作流对比
| 普通浏览器路径 | NewsCrawler Skill 路径 |
|---|---|
| URL → 打开浏览器 → 加载 DOM → 识别正文 → 清理噪声 → 推理 | URL → 匹配平台 → 代码提取正文 → 统一 NewsItem → 推理 |
| 上下文包含脚本、导航、广告、推荐与重复链接 | 上下文只包含标题、元数据、有序正文和媒体 |
| Agent 每次都要重新理解站点结构 | 平台规则由 Adapter 维护,可测试、可复用 |
| 需要浏览器会话与多轮工具调用 | 本地命令执行,不需要常驻服务 |
四、安装与部署教程
4.1 方式一:Docker Compose(⭐ 推荐 — 一键部署)
系统要求:
- Docker >= 20.10
- Docker Compose >= 2.0
- 系统内存 >= 4GB(推荐)
- 磁盘空间 >= 5GB
步骤:
# 1. 克隆项目 git clone https://github.com/NanmiCoder/NewsCrawler.git cd NewsCrawler # 2. 一键启动所有服务 docker compose up -d
这将启动三个服务:
- Backend(FastAPI) — 端口 8000,提供新闻提取 API
- MCP Server — 端口 8765,提供 AI Agent 工具
- Frontend(Vue 3 + Nginx) — 端口 3000,提供 Web UI 界面
验证服务状态:
docker compose ps
期望输出显示三个服务均为 Up 状态。
访问服务:
- 前端界面:http://localhost:3000
- 后端 API 文档:http://localhost:8000/docs
- MCP 服务:http://localhost:8765/mcp
常用管理命令:
# 查看所有服务日志 docker compose logs -f # 查看特定服务日志 docker compose logs -f backend # 停止服务 docker compose down # 代码更新后重新构建 docker compose up -d --build
4.2 方式二:Web UI(手动部署)
# 1. 安装 uv(极速 Python 包管理器) curl -LsSf https://astral.sh/uv/install.sh | sh # 或: pip install uv # 2. 克隆项目 git clone https://github.com/NanmiCoder/NewsCrawler.git cd NewsCrawler # 3. 后续参照项目 README 完成依赖安装和启动
4.3 方式三:作为 Agent Skill 安装(适用于 Claude Code / Codex)
npx skills add NanmiCoder/NewsCrawler --skill news-extractor -g
或针对中国新闻站点:
npx skill4agent add nanmicoder/newscrawler china-news-crawler
五、使用建议
5.1 明确使用场景
NewsCrawler 最适合以下场景:
- AI 新闻聚合:为 AI 应用提供结构化的新闻数据输入
- 内容分析:批量抓取多平台文章进行舆情分析、趋势研究
- 大模型 RAG:为检索增强生成(RAG)系统提供高质量新闻语料
- 自动化内容创作:结合 AI 摘要、翻译、改写等能力构建内容流水线
5.2 注意反爬策略
⚠️ 重要提示:网站结构、登录策略和反爬规则会持续变化。遇到失败时,先确认 URL 形态、网络访问和 Cookie 要求,再检查对应的 Adapter。
建议:
- 合理设置请求间隔,避免对目标站点造成压力
- 遵守目标网站的 robots.txt 规则
- 关注项目更新,及时获取适配器修复
5.3 扩展与定制
NewsCrawler 采用模块化设计,各平台爬虫相互解耦。如需添加新平台或优化现有实现,可以:
- 在
adapters目录下创建新的平台适配器 - 实现统一的
NewsItem输出接口 - 提交 Pull Request 回馈社区
5.4 数据持久化
Docker 部署时,提取的新闻数据默认保存在 ./data/ 目录。建议:
- 定期备份数据目录
- 如需长期存储,可配置外部数据库(如 MongoDB、Elasticsearch)
5.5 与 AI Agent 集成
NewsCrawler 原生支持 MCP(Model Context Protocol) ,可以无缝接入:
- Claude Desktop:通过 MCP 服务让 Claude 直接调用新闻提取能力
- Claude Code:在编程场景中快速获取新闻内容作为上下文
- 其他 MCP 兼容的 AI 工具:如 Cursor 等
六、总结
NewsCrawler 是一个面向 AI Agent 时代设计的新闻内容提取工具。它通过将 12 个主流平台的抓取逻辑封装为可迁移的 Agent Skill,解决了传统爬虫在 AI 工作流中的两大痛点:
- Token 浪费:将 59,788 tokens 的 DOM 压缩至 1,730 tokens 的结构化 JSON
- 重复劳动:让 Agent 不必每次重新理解站点结构,平台规则由 Adapter 维护、可测试、可复用
无论是通过 Docker 一键部署,还是作为 Agent Skill 直接集成,NewsCrawler 都为开发者提供了一条低成本、高效率的多平台新闻内容获取路径。
数据统计
数据评估
关于NewsCrawler特别声明
本站微企脉提供的NewsCrawler都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月28日 下午10:58收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航
OpenMontage 是全球首个开源的 AI Agentic(智能体驱动)视频制作系统。由 Calesthio AI Labs 开发,采用 MIT 许可证。简单来说:你给 AI 编程助手一句话需求,它自动完成调研、脚本、分镜、素材生成、配音、剪辑、合成的全流程。
GitHub中文排行榜
GitHub中文排行榜是一个专注于中文项目的 GitHub 榜单 。它通过自动化脚本,定期筛选并排名 GitHub 上包含中文文档或由中文社区主导的热门开源项目 。其核心目标是打破语言壁垒,解决开发者在海量英文项目中难以找到优质中文资源的痛点 。
SnapAny
SnapAny是一个免费的在线及桌面端多媒体下载工具,主打从上千个网站一键保存视频和图片。支持包括YouTube、抖音、Bilibili、TikTok、Facebook、Pinterest等主流国内外平台。
wigolo
wigolo(读音类似“威狗罗”)是一个开源的本地优先Web情报工具,专为AI Agent设计。它把搜索、网页抓取、爬虫、信息提取、缓存、深度研究等功能全部封装进一个本地MCP Server中,通过MCP(Model Context Protocol)协议与AI编程助手通信。核心定位:让AI Agent拥有“本地联网大脑”——不需要API Key、不按次数付费、所有数据留在本地机器上。
AI Vocal Remover
AI Vocal Remover是一个利用尖端人工智能技术进行音频分离的在线平台。该工具的核心功能是精准地从任何歌曲中分离人声和伴奏,满足用户从创建卡拉OK版本、提取Acapella(纯人声)到隔离特定乐器音轨等多种需求 。
Prism Browser Community
Prism Browser Community 是一个基于定制 Chromium 的本地指纹浏览器环境管理器,与传统多开浏览器不同,Prism 为每个浏览器环境提供独立的 Cookie、缓存、扩展数据、代理设置和指纹配置,实现多账号隔离管理,且所有数据默认只保存在用户自己的设备上。项目的核心定位是 Local-first(本地优先) ——Community 版本完全免费,且不限制本地环境数量。
Proxifly's Free Proxy List
Proxifly's Free Proxy List 是一个在 GitHub 上开源的、自动化更新的免费代理列表项目,旨在为开发者、测试人员及普通用户提供可靠、及时且结构化的代理服务器资源。
DataTool.vip
DataTool.vip 是提免费在线视频下载的在线工具网站,涵盖 TikTok、Instagram、Twitter、Facebook、Dailymotion、Vimeo 以及几乎所有网站。快速、无水印,支持高达 4K 分辨率。下载您想要的任何视频!
ego (lite)
ego (lite) 是由 Citro Labs 开发的一款基于 Chromium 内核的浏览器,它的核心定位非常直接:一个让你和 AI Agent 可以同时使用的浏览器。你在前台刷网页,Agent 在独立的 Space 里跑任务——同一个 Chromium 内核,两套完全独立的工作空间,互不干扰。
Raphael AI
Raphael AI 是一个完全免费、无需注册、无限生成的AI图像平台,口号是“全球首个无限免费AI图像生成器”。其核心优势在于场景感知智能路由,系统会根据你的提示,自动在 Z-Image、Flux 2、Qwen-Image、Nano Banana Pro 等先进模型中选择最合适的一个,兼顾质量与速度。
Zread
Zread.ai 是由智谱(Z.ai)公司推出的一款创新的AI代码阅读与理解工具,旨在帮助开发者高效地理解和导航GitHub等平台上的代码库。它就像是一个为开发者准备的“阅读神器”,能将复杂的开源项目一键转化为清晰易懂的文档和指南。
PostBot
PostBot 是一款开源的多平台内容同步分发生产力工具,以 Chrome 浏览器扩展的形式运行。它的核心价值在于:你只需创作一次内容,即可一键同步发布至国内外 20+ 主流媒体平台。PostBot 支持文章、笔记、动态、图片、视频、音频等多种内容类型,文本内容兼容 HTML 和 Markdown 格式。无论你是写长文、发短动态,还是做视频图文,都能一站搞定。
暂无评论...






