NewsCrawler

2小时前发布 3 00

NewsCrawler 是由 NanmiCoder 开发的一款多平台新闻与内容爬虫集合,支持微信公众号、今日头条、网易新闻、搜狐新闻、腾讯新闻、BBC News、CNN News、Twitter/X、Naver Blog、Detik News、Quora、Lenny‘s Newsletter 等 12 个主流新闻与内容平台。

收录时间:
2026-08-28
NewsCrawlerNewsCrawler

一、项目概述:给 Agent 一条 URL,直接拿到正文

NewsCrawler 是由 NanmiCoder 开发的开源多平台新闻与内容爬虫集合。它的核心理念极简而高效:给 Agent 一条 URL,直接拿到正文、图片和元数据;不启动浏览器,不把整页 DOM 塞进上下文

与传统新闻爬虫不同,NewsCrawler 的首要产品是可迁移的 news-extractor Agent Skill——它将 12 个主流新闻与内容平台的抓取代码打包在一个自包含目录中,让 Codex、Claude Code 或其他支持 SKILL.md 的 Agent 在本地直接提取文章,返回统一的 JSON 或 Markdown 格式。

截至 2026 年 8 月,该项目在 GitHub 上已获得 488+ Stars 和 84 Forks,并持续获得更新维护。

二、支持的平台

NewsCrawler 支持 12 个主流新闻与内容平台

平台URL 识别示例
微信公众号mp.weixin.qq.com/s/...
今日头条toutiao.com/article/...
网易新闻163.com/news/article/...
搜狐新闻sohu.com/a/...
腾讯新闻news.qq.com/rain/a/...
Lenny's Newsletterlennysnewsletter.com/...
Naver Blog*.naver.com/...
Detik Newsnews.detik.com/...
Quora*.quora.com/...
BBC Newsbbc.com/news/articles/...
CNN Newscnn.com/YYYY/MM/DD/...
Twitter/Xx.com/<user>/status/<id>

此外,项目还提供了中国新闻站点专用 Skillchina-news-crawler),专门针对微信公众号、今日头条、网易新闻、搜狐新闻、腾讯新闻进行优化。

三、为什么选择 NewsCrawler?

3.1 核心优势

特性说明
全平台覆盖12 个主流平台,覆盖中、英、韩、印尼等多语种内容
智能提取自动识别平台类型,提取标题、正文、图片、视频等多媒体内容
统一输出所有平台输出标准化 JSON 格式,完美适配数据分析、入库、下游处理
灵活使用支持 Python API(自动化)+ Web UI(可视化)+ MCP Server(AI Agent)
一键部署Docker Compose 编排所有服务(后端 + 前端 + MCP)
AI智能体集成支持 MCP 协议,可接入 Claude Desktop 等 AI工具
模块化设计各平台爬虫解耦,易于扩展新平台或优化现有实现
轻量高效使用 uv 管理依赖,安装快速,运行稳定

3.2 Token 效率:实测数据

NewsCrawler 最突出的价值在于大幅降低 AI Agent 处理新闻内容的 Token 消耗。2026 年 7 月 20 日,项目团队用一篇真实的 Detik News 文章做了对照测试:

输入给 Agent 的内容Token 数相比完整 DOM
浏览器渲染 DOM59,788基线
浏览器无障碍快照6,842少 88.56%
浏览器可见文本1,907少 96.81%
Skill 结构化 JSON1,730少 97.11%
Skill Markdown633少 98.94%

结构化 JSON 从 59,788 tokens 降至 1,730 tokens,体积仅为浏览器 DOM 的 1/34.56。这意味着:

  • 更低的 API 调用成本
  • 更快的推理速度
  • 把昂贵的模型上下文留给总结、检索、比较和判断

3.3 Agent工作流对比

普通浏览器路径NewsCrawler Skill 路径
URL → 打开浏览器 → 加载 DOM → 识别正文 → 清理噪声 → 推理URL → 匹配平台 → 代码提取正文 → 统一 NewsItem → 推理
上下文包含脚本、导航、广告、推荐与重复链接上下文只包含标题、元数据、有序正文和媒体
Agent 每次都要重新理解站点结构平台规则由 Adapter 维护,可测试、可复用
需要浏览器会话与多轮工具调用本地命令执行,不需要常驻服务

四、安装与部署教程

4.1 方式一:Docker Compose(⭐ 推荐 — 一键部署)

系统要求

  • Docker >= 20.10
  • Docker Compose >= 2.0
  • 系统内存 >= 4GB(推荐)
  • 磁盘空间 >= 5GB

步骤

# 1. 克隆项目
git clone https://github.com/NanmiCoder/NewsCrawler.git
cd NewsCrawler

# 2. 一键启动所有服务
docker compose up -d

这将启动三个服务:

  • Backend(FastAPI) — 端口 8000,提供新闻提取 API
  • MCP Server — 端口 8765,提供 AI Agent 工具
  • Frontend(Vue 3 + Nginx) — 端口 3000,提供 Web UI 界面

验证服务状态

docker compose ps

期望输出显示三个服务均为 Up 状态。

访问服务

常用管理命令

# 查看所有服务日志
docker compose logs -f

# 查看特定服务日志
docker compose logs -f backend

# 停止服务
docker compose down

# 代码更新后重新构建
docker compose up -d --build

4.2 方式二:Web UI(手动部署)

# 1. 安装 uv(极速 Python 包管理器)
curl -LsSf https://astral.sh/uv/install.sh | sh
# 或: pip install uv

# 2. 克隆项目
git clone https://github.com/NanmiCoder/NewsCrawler.git
cd NewsCrawler

# 3. 后续参照项目 README 完成依赖安装和启动

4.3 方式三:作为 Agent Skill 安装(适用于 Claude Code / Codex)

npx skills add NanmiCoder/NewsCrawler --skill news-extractor -g

或针对中国新闻站点:

npx skill4agent add nanmicoder/newscrawler china-news-crawler

五、使用建议

5.1 明确使用场景

NewsCrawler 最适合以下场景:

  • AI 新闻聚合:为 AI 应用提供结构化的新闻数据输入
  • 内容分析:批量抓取多平台文章进行舆情分析、趋势研究
  • 大模型 RAG:为检索增强生成(RAG)系统提供高质量新闻语料
  • 自动化内容创作:结合 AI 摘要、翻译、改写等能力构建内容流水线

5.2 注意反爬策略

⚠️ 重要提示:网站结构、登录策略和反爬规则会持续变化。遇到失败时,先确认 URL 形态、网络访问和 Cookie 要求,再检查对应的 Adapter。

建议:

  • 合理设置请求间隔,避免对目标站点造成压力
  • 遵守目标网站的 robots.txt 规则
  • 关注项目更新,及时获取适配器修复

5.3 扩展与定制

NewsCrawler 采用模块化设计,各平台爬虫相互解耦。如需添加新平台或优化现有实现,可以:

  1. 在 adapters 目录下创建新的平台适配器
  2. 实现统一的 NewsItem 输出接口
  3. 提交 Pull Request 回馈社区

5.4 数据持久化

Docker 部署时,提取的新闻数据默认保存在 ./data/ 目录。建议:

  • 定期备份数据目录
  • 如需长期存储,可配置外部数据库(如 MongoDB、Elasticsearch)

5.5 与 AI Agent 集成

NewsCrawler 原生支持 MCP(Model Context Protocol) ,可以无缝接入:

  • Claude Desktop:通过 MCP 服务让 Claude 直接调用新闻提取能力
  • Claude Code:在编程场景中快速获取新闻内容作为上下文
  • 其他 MCP 兼容的 AI 工具:如 Cursor 等

六、总结

NewsCrawler 是一个面向 AI Agent 时代设计的新闻内容提取工具。它通过将 12 个主流平台的抓取逻辑封装为可迁移的 Agent Skill,解决了传统爬虫在 AI 工作流中的两大痛点:

  1. Token 浪费:将 59,788 tokens 的 DOM 压缩至 1,730 tokens 的结构化 JSON
  2. 重复劳动:让 Agent 不必每次重新理解站点结构,平台规则由 Adapter 维护、可测试、可复用

无论是通过 Docker 一键部署,还是作为 Agent Skill 直接集成,NewsCrawler 都为开发者提供了一条低成本、高效率的多平台新闻内容获取路径。

数据统计

数据评估

NewsCrawler浏览人数已经达到3,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:NewsCrawler的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找NewsCrawler的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于NewsCrawler特别声明

本站微企脉提供的NewsCrawler都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月28日 下午10:58收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。

相关导航

秒哒,0代码一句话做应用

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...