一、项目概述:给 Agent 一条 URL,直接拿到正文
NewsCrawler 是由 NanmiCoder 开发的开源多平台新闻与内容爬虫集合。它的核心理念极简而高效:给 Agent 一条 URL,直接拿到正文、图片和元数据;不启动浏览器,不把整页 DOM 塞进上下文。
与传统新闻爬虫不同,NewsCrawler 的首要产品是可迁移的 news-extractor Agent Skill——它将 12 个主流新闻与内容平台的抓取代码打包在一个自包含目录中,让 Codex、Claude Code 或其他支持 SKILL.md 的 Agent 在本地直接提取文章,返回统一的 JSON 或 Markdown 格式。
截至 2026 年 8 月,该项目在 GitHub 上已获得 488+ Stars 和 84 Forks,并持续获得更新维护。
二、支持的平台
NewsCrawler 支持 12 个主流新闻与内容平台:
| 平台 | URL 识别示例 |
|---|---|
| 微信公众号 | mp.weixin.qq.com/s/... |
| 今日头条 | toutiao.com/article/... |
| 网易新闻 | 163.com/news/article/... |
| 搜狐新闻 | sohu.com/a/... |
| 腾讯新闻 | news.qq.com/rain/a/... |
| Lenny's Newsletter | lennysnewsletter.com/... |
| Naver Blog | *.naver.com/... |
| Detik News | news.detik.com/... |
| Quora | *.quora.com/... |
| BBC News | bbc.com/news/articles/... |
| CNN News | cnn.com/YYYY/MM/DD/... |
| Twitter/X | x.com/<user>/status/<id> |
此外,项目还提供了中国新闻站点专用 Skill(china-news-crawler),专门针对微信公众号、今日头条、网易新闻、搜狐新闻、腾讯新闻进行优化。
三、为什么选择 NewsCrawler?
3.1 核心优势
| 特性 | 说明 |
|---|---|
| 全平台覆盖 | 12 个主流平台,覆盖中、英、韩、印尼等多语种内容 |
| 智能提取 | 自动识别平台类型,提取标题、正文、图片、视频等多媒体内容 |
| 统一输出 | 所有平台输出标准化 JSON 格式,完美适配数据分析、入库、下游处理 |
| 灵活使用 | 支持 Python API(自动化)+ Web UI(可视化)+ MCP Server(AI Agent) |
| 一键部署 | Docker Compose 编排所有服务(后端 + 前端 + MCP) |
| AI智能体集成 | 支持 MCP 协议,可接入 Claude Desktop 等 AI工具 |
| 模块化设计 | 各平台爬虫解耦,易于扩展新平台或优化现有实现 |
| 轻量高效 | 使用 uv 管理依赖,安装快速,运行稳定 |
3.2 Token 效率:实测数据
NewsCrawler 最突出的价值在于大幅降低 AI Agent 处理新闻内容的 Token 消耗。2026 年 7 月 20 日,项目团队用一篇真实的 Detik News 文章做了对照测试:
| 输入给 Agent 的内容 | Token 数 | 相比完整 DOM |
|---|---|---|
| 浏览器渲染 DOM | 59,788 | 基线 |
| 浏览器无障碍快照 | 6,842 | 少 88.56% |
| 浏览器可见文本 | 1,907 | 少 96.81% |
| Skill 结构化 JSON | 1,730 | 少 97.11% |
| Skill Markdown | 633 | 少 98.94% |
结构化 JSON 从 59,788 tokens 降至 1,730 tokens,体积仅为浏览器 DOM 的 1/34.56。这意味着:
- 更低的 API 调用成本
- 更快的推理速度
- 把昂贵的模型上下文留给总结、检索、比较和判断
3.3 Agent工作流对比
| 普通浏览器路径 | NewsCrawler Skill 路径 |
|---|---|
| URL → 打开浏览器 → 加载 DOM → 识别正文 → 清理噪声 → 推理 | URL → 匹配平台 → 代码提取正文 → 统一 NewsItem → 推理 |
| 上下文包含脚本、导航、广告、推荐与重复链接 | 上下文只包含标题、元数据、有序正文和媒体 |
| Agent 每次都要重新理解站点结构 | 平台规则由 Adapter 维护,可测试、可复用 |
| 需要浏览器会话与多轮工具调用 | 本地命令执行,不需要常驻服务 |
四、安装与部署教程
4.1 方式一:Docker Compose(⭐ 推荐 — 一键部署)
系统要求:
- Docker >= 20.10
- Docker Compose >= 2.0
- 系统内存 >= 4GB(推荐)
- 磁盘空间 >= 5GB
步骤:
# 1. 克隆项目 git clone https://github.com/NanmiCoder/NewsCrawler.git cd NewsCrawler # 2. 一键启动所有服务 docker compose up -d
这将启动三个服务:
- Backend(FastAPI) — 端口 8000,提供新闻提取 API
- MCP Server — 端口 8765,提供 AI Agent 工具
- Frontend(Vue 3 + Nginx) — 端口 3000,提供 Web UI 界面
验证服务状态:
docker compose ps
期望输出显示三个服务均为 Up 状态。
访问服务:
- 前端界面:http://localhost:3000
- 后端 API 文档:http://localhost:8000/docs
- MCP 服务:http://localhost:8765/mcp
常用管理命令:
# 查看所有服务日志 docker compose logs -f # 查看特定服务日志 docker compose logs -f backend # 停止服务 docker compose down # 代码更新后重新构建 docker compose up -d --build
4.2 方式二:Web UI(手动部署)
# 1. 安装 uv(极速 Python 包管理器) curl -LsSf https://astral.sh/uv/install.sh | sh # 或: pip install uv # 2. 克隆项目 git clone https://github.com/NanmiCoder/NewsCrawler.git cd NewsCrawler # 3. 后续参照项目 README 完成依赖安装和启动
4.3 方式三:作为 Agent Skill 安装(适用于 Claude Code / Codex)
npx skills add NanmiCoder/NewsCrawler --skill news-extractor -g
或针对中国新闻站点:
npx skill4agent add nanmicoder/newscrawler china-news-crawler
五、使用建议
5.1 明确使用场景
NewsCrawler 最适合以下场景:
- AI 新闻聚合:为 AI 应用提供结构化的新闻数据输入
- 内容分析:批量抓取多平台文章进行舆情分析、趋势研究
- 大模型 RAG:为检索增强生成(RAG)系统提供高质量新闻语料
- 自动化内容创作:结合 AI 摘要、翻译、改写等能力构建内容流水线
5.2 注意反爬策略
⚠️ 重要提示:网站结构、登录策略和反爬规则会持续变化。遇到失败时,先确认 URL 形态、网络访问和 Cookie 要求,再检查对应的 Adapter。
建议:
- 合理设置请求间隔,避免对目标站点造成压力
- 遵守目标网站的 robots.txt 规则
- 关注项目更新,及时获取适配器修复
5.3 扩展与定制
NewsCrawler 采用模块化设计,各平台爬虫相互解耦。如需添加新平台或优化现有实现,可以:
- 在
adapters目录下创建新的平台适配器 - 实现统一的
NewsItem输出接口 - 提交 Pull Request 回馈社区
5.4 数据持久化
Docker 部署时,提取的新闻数据默认保存在 ./data/ 目录。建议:
- 定期备份数据目录
- 如需长期存储,可配置外部数据库(如 MongoDB、Elasticsearch)
5.5 与 AI Agent 集成
NewsCrawler 原生支持 MCP(Model Context Protocol) ,可以无缝接入:
- Claude Desktop:通过 MCP 服务让 Claude 直接调用新闻提取能力
- Claude Code:在编程场景中快速获取新闻内容作为上下文
- 其他 MCP 兼容的 AI 工具:如 Cursor 等
六、总结
NewsCrawler 是一个面向 AI Agent 时代设计的新闻内容提取工具。它通过将 12 个主流平台的抓取逻辑封装为可迁移的 Agent Skill,解决了传统爬虫在 AI 工作流中的两大痛点:
- Token 浪费:将 59,788 tokens 的 DOM 压缩至 1,730 tokens 的结构化 JSON
- 重复劳动:让 Agent 不必每次重新理解站点结构,平台规则由 Adapter 维护、可测试、可复用
无论是通过 Docker 一键部署,还是作为 Agent Skill 直接集成,NewsCrawler 都为开发者提供了一条低成本、高效率的多平台新闻内容获取路径。
数据统计
数据评估
关于NewsCrawler特别声明
本站微企脉提供的NewsCrawler都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月28日 下午10:58收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航
wormhole专注于普通用户间安全、私密传输大文件的免费工具网站。无需注册,直接通过浏览器端到端加密分享最大10GB的文件,并生成可设置自动过期的链接。
WeWrite
WeWrite 不是传统意义上的“写作软件”,而是一个内容生产 Skill——你可以把它理解为一个装在 AI 助手里的“公众号编辑部”。它的核心理念是:一句话完成正文,后续动作真正独立。WeWrite 把公众号内容创作从“手工作坊”升级到了“流水线”——但你依然是那个把控方向的 editor。它不替你思考,它替你执行。
Scrapling
Scrapling是一个为“现代网络”而生的爬虫框架。它的自适应解析和一站式反爬能力直击当前爬虫开发的痛点,而其AI 集成特性又使其站在了技术发展的前沿。如果你的爬虫常常因网站改版或反爬机制而失效,Scrapling 值得你投入时间去尝试。

美算AI
一款面向电商场景的 AI 生图与视频生成平台,可帮助商家快速生成商品图、服装图、模特换装图、商品组图以及短视频营销素材。美算AI是面向电商卖家的AI生成工具,支持免费商品套图、服装套图、商品图文转视频和视频复刻。
识典古籍
识典古籍是一个由北京大学和字节跳动联合共建的公益性古籍数字化平台,致力于利用AI技术让珍贵古籍“活”起来,免费向公众开放。它不仅仅是一个在线阅读网站,更是一个集阅读、研究、整理于一体的智能化平台。
ImageToURL
ImageToURL是一个旨在将本地图片快速转换为网络链接的免费在线托管平台。它的核心服务承诺简单、免费且高效,是各类用户在线分享和嵌入图片的实用选择。
LiveTalking
LiveTalking作为目前GitHub上最活跃的开源实时数字人引擎之一,凭借其低延迟架构(<300ms)、多模型支持(4种渲染方案)、多协议输出(WebRTC/RTMP/虚拟摄像头)和生产级并发能力,已成为个人开发者、中小企业和内容创作者搭建数字人应用的优选方案。
ImagePrompt
ImagePrompt图片转提示词是一个完全免费、无需注册的在线工具,它利用AI技术将图片转换为精准的文本提示词,旨在帮助创作者无缝衔接灵感与AI绘画实践。
Gemini Web2API
gemini-web2api是一个开源工具,模拟用户与 Gemini 网页版的交互,将对话接口包装成标准的 REST API,且兼容 OpenAI 的 /v1/chat/completions 格式。这意味着,任何支持自定义 OpenAI API 端点的客户端(如 ChatBox、NextChat、LangChain 等)都可以直接接入。
PostBot
PostBot 是一款开源的多平台内容同步分发生产力工具,以 Chrome 浏览器扩展的形式运行。它的核心价值在于:你只需创作一次内容,即可一键同步发布至国内外 20+ 主流媒体平台。PostBot 支持文章、笔记、动态、图片、视频、音频等多种内容类型,文本内容兼容 HTML 和 Markdown 格式。无论你是写长文、发短动态,还是做视频图文,都能一站搞定。
TrendRadar
TrendRadar定位为一款AI舆情监控助手与热点筛选工具。其核心理念是告别信息过载和算法操控,让用户从被动接收 App 推送,转变为根据自己的兴趣和需求,主动、精准地获取全网热点信息。它就像为你打造的“私有情报局”,帮你从海量资讯中筛选出真正有价值的内容。
baoyu-skills
baoyu-skills 是一套Agent Skills技能集,专为Claude Code、Codex、OpenClaw等AI Agent设计,用于提升日常工作效率。如果说AI大模型是一个“很聪明但只会聊天”的顾问,baoyu-skills就是给这个顾问配上了一整套“会干活”的工具箱——你说“把这篇文章发公众号”,它自己去排版、配图、填草稿箱。它的核心价值在于:把原本散落在不同工具之间的动作,封装成可以直接安装、直接调用的技能。
暂无评论...






