
一、什么是Browser Use?
Browser Use是一个开源的Python库,专门用于AI驱动的浏览器自动化。它的核心理念极其简单却极具颠覆性:让AI Agent像人类一样“看到”网页、理解内容、做出决策并执行操作。
你不需要编写一行选择器代码,只需用自然语言描述你想做什么,AI就会自动拆解任务、规划步骤、操控真实浏览器完成整个流程。
项目由Magnus Müller和Gregor Zunic于2024年创立,两人在苏黎世联邦理工学院的创业加速器中相识并萌生想法。2025年,Browser Use成为Y Combinator冬季班项目,并完成1700万美元种子轮融资。截至2026年8月,项目在GitHub已收获超过10.4万Star。
- 官网:https://browser-use.com/
- GitHub:https://github.com/browser-use/browser-use
- 云端版:https://cloud.browser-use.com/
二、为什么Browser Use正在颠覆浏览器自动化?
2.1 传统方式 vs Browser Use
| 维度 | 传统自动化(Selenium/Playwright) | Browser Use |
|---|---|---|
| 操作方式 | 编写代码、定位XPath/CSS选择器 | 自然语言描述任务 |
| 页面变化 | 脚本崩溃,需手动维护 | AI自适应,自动识别元素 |
| 技术门槛 | 需要编程能力 | 无需代码,人人可用 |
| 反爬处理 | 需手动配置代理、指纹 | 云端版内置Stealth浏览器+CAPTCHA破解 |
| 维护成本 | 高(随页面迭代反复修改) | 低(AI自动适配) |
2.2 核心能力一览
- 多标签页管理:支持同时打开和切换多个标签页
- 视觉识别与内容提取:结合计算机视觉与HTML结构解析
- 多种LLM支持:OpenAI、Anthropic、Google Gemini、Qwen、DeepSeek-R1等
- 自我纠正机制:发现错误时自动重试或调整策略
- MCP双向支持:可作为MCP服务端供Claude Desktop、Cursor调用,也可作为客户端连接外部MCP工具
2.3 性能标杆
根据官方Benchmark(2026年3月,Online-Mind2Web标准,300个真实网页任务):
| 工具/模型 | 准确率 |
|---|---|
| Browser Use Cloud (v4) | 98% |
| ABP + Opus 4.6 | 86% |
| TinyFish Navigator | 81% |
| Gemini CUA | 69% |
| OpenAI Operator | 61% |
Browser Use Cloud以98%的准确率遥遥领先。在WebVoyager基准上,开源版也达到了89%的成功率。此外,Browser Use在Odysseys排行榜上位列第一(87.4%平均分),超越了OpenAI、Anthropic、Google和Microsoft的同类产品。
三、快速上手教程(5分钟跑起来)
3.1 环境准备
- Python 3.11或更高版本
- 任意LLM的API Key(OpenAI、Anthropic、Google等)
3.2 安装
# 安装核心库(推荐安装core版本以使用Rust原生核心) pip install "browser-use[core]" # 或 uv add "browser-use[core]" # 安装Playwright浏览器内核 playwright install chromium
3.3 配置API Key
在项目根目录创建.env文件:
# 任选一种LLM提供商的Key即可 OPENAI_API_KEY=your-openai-key # 或 ANTHROPIC_API_KEY=your-anthropic-key # 或 GOOGLE_API_KEY=your-google-key # 或使用Browser Use官方优化模型(推荐,速度3-5倍) BROWSER_USE_API_KEY=your-browser-use-key
3.4 第一个Agent
import asyncio
from browser_use import Agent
from browser_use.llm import ChatOpenAI # 或其他LLM
async def main():
agent = Agent(
task="打开GitHub,找到browser-use/browser-use仓库,告诉我它有多少Star",
llm=ChatOpenAI(model="gpt-4o"),
)
history = await agent.run()
print(history.final_result())
if __name__ == "__main__":
asyncio.run(main())
运行后,AI会自动打开浏览器、导航到GitHub、找到仓库页面、读取Star数量并返回结果——全程无需任何选择器代码。
3.5 Browser Use 0.13新特性(2026年重磅更新)
2026年6月发布的0.13.0版本是一次重大技术重构:
- Rust核心:底层从Python重写为Rust,性能大幅提升
- 执行链路:
Python API → Rust core → Browser harness → Web task done - Browser Use CLI 3.0:支持从终端直接运行,与Claude Code、Cursor等编码Agent无缝集成
3.6 Code Use:直接用代码控制浏览器(0.9.0+)
2026年6月推出的Code Use功能,让AI直接输出Python/JavaScript代码,通过Chrome DevTools Protocol (CDP)操控浏览器,绕过视觉识别和鼠标点击的中间层,效率和准确性更高。
from browser_use import CodeAgent
async def main():
agent = CodeAgent(
task="从电商网站抓取50个商品的价格和折扣信息",
max_steps=30,
)
await agent.run()
⚠️ 注意:Code Agent会写入和执行代码,生产环境使用需谨慎。
四、进阶使用技巧与最佳实践
4.1 浏览器配置定制
from browser_use import Agent, Browser, BrowserConfig
browser = Browser(
config=BrowserConfig(
headless=False, # 开发时显示浏览器窗口
viewport={"width": 1280, "height": 720},
allowed_domains=["*.github.com"], # 限制访问域名
)
)
agent = Agent(
task="你的任务",
llm=your_llm,
browser=browser,
)
4.2 与编码Agent集成(Skill安装)
# 一键安装Browser Use Skill到Claude Code、Cursor等 browser-use skill install
之后直接告诉你的编码Agent“用浏览器做XXX”,它就能自动调用Browser Use。
4.3 MCP服务端模式
将Browser Use作为MCP服务端运行,供Claude Desktop、Cursor等调用:
# 配置MCP服务端后,在Claude中直接说: # "用Browser Use帮我查询今天的热门新闻"
4.4 云端部署(推荐生产环境)
对于生产级任务,推荐使用Browser Use Cloud:
- 免费套餐:无需信用卡,包含Stealth浏览器、CAPTCHA破解、195+国家住宅代理
- 付费套餐:从$29/月起
- 按需付费:最低充值降至$5
五、适用场景与局限性
✅ 最佳适用场景
| 场景 | 说明 |
|---|---|
| 自动化测试 | QA测试、回归测试,无需维护脚本 |
| 数据采集 | 电商比价、社交媒体数据抓取 |
| 表单填写 | 批量填表、简历投递 |
| 后台任务 | 登录后操作、筛选器操作、弹窗处理 |
| 深度研究 | 自动搜集信息、生成研究报告 |
⚠️ 需要注意的局限
- Token消耗较大:复杂任务可能消耗大量Token
- 复杂JS站点可能失败:LLM推理增加延迟和成本
- 自托管需运维能力:需自行管理计算资源和浏览器基础设施
- 云端版数据隐私:标准套餐用户输入可能用于模型训练,敏感数据建议使用开源自托管版本
六、总结建议
如果你是以下人群,Browser Use值得立刻上手:
- 🧪 测试工程师:告别脆弱的XPath脚本,用自然语言驱动自动化测试
- 📊 数据采集者:轻松应对需要登录、有反爬的复杂网站
- 🤖 AI应用开发者:为你的Agent赋予“动手操作网页”的能力
- 💼 业务人员:无需编程,用一句话完成重复性网页操作
入门路径建议:
- 先用
pip install browser-use跑通第一个示例 - 尝试用自然语言描述你的真实任务
- 复杂任务考虑升级到Browser Use Cloud(免费套餐即可体验)
- 生产部署使用0.13+版本的Rust核心,性能和稳定性更佳
🔗 官方资源汇总:
数据统计
数据评估
关于Browser Use特别声明
本站微企脉提供的Browser Use都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月23日 下午11:36收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航

玩创公众号陪玩树洞系统,基于 FastAdmin 框架开发,可快速搭建公众号 + H5 陪玩平台。系统支持微信授权、全流程运营、多支付对接、智能派单及消息推送,后台可高度自定义,提供源码、教程与技术协助,零基础即可部署上线。
Scrapling
Scrapling是一个为“现代网络”而生的爬虫框架。它的自适应解析和一站式反爬能力直击当前爬虫开发的痛点,而其AI 集成特性又使其站在了技术发展的前沿。如果你的爬虫常常因网站改版或反爬机制而失效,Scrapling 值得你投入时间去尝试。
12377举报中心
违法和不良信息举报中心是由中央网信办(国家互联网信息办公室)设立的全国性网络举报官方平台。主要受理网民对互联网上色情、赌博、侵权、谣言等违法和不良信息的举报。举报中心的主要职责包括:统筹协调全国互联网违法和不良信息举报工作;指导、监督各地各网站规范开展举报工作;受理、协助处置网民对互联网违法和不良信息的举报;主办中国互联网联合辟谣平台等。
Raphael AI
Raphael AI 是一个完全免费、无需注册、无限生成的AI图像平台,口号是“全球首个无限免费AI图像生成器”。其核心优势在于场景感知智能路由,系统会根据你的提示,自动在 Z-Image、Flux 2、Qwen-Image、Nano Banana Pro 等先进模型中选择最合适的一个,兼顾质量与速度。
Prompt Optimizer
Prompt Optimizer是一个开源的 AI 提示词优化工具,旨在帮助用户编写更高质量的提示词,从而显著提升 AI 模型的输出效果。它通过智能优化、双模式优化(支持系统提示词和用户提示词)以及实时对比测试等核心功能,让提示词的打磨过程变得更加高效和直观。
WeWrite
WeWrite 不是传统意义上的“写作软件”,而是一个内容生产 Skill——你可以把它理解为一个装在 AI 助手里的“公众号编辑部”。它的核心理念是:一句话完成正文,后续动作真正独立。WeWrite 把公众号内容创作从“手工作坊”升级到了“流水线”——但你依然是那个把控方向的 editor。它不替你思考,它替你执行。
TOOLFK
TOOLFK在线工具箱是一个为程序员、开发者及普通办公人员提供便捷服务的综合性在线工具集合网站。其核心特点是无需安装、无需注册(大部分工具),直接在浏览器中完成各种任务。
中国家谱知识服务平台
中国家谱知识服务平台是由上海图书馆构建的一个权威、专业的在线...
PolyPost
PolyPost是一个开源的多平台内容自动发布工具,它的核心逻辑极其简单:你只需要写好一篇Markdown文章,勾选要发布的平台,点击一次「发布」按钮,后端就会自动完成所有平台的格式转换和内容推送。它不经过任何第三方服务器中转你的内容,完全免费,数据安全由你自己掌控。
Auto PY to EXE
Auto PY to EXE本质上是在PyInstaller上构建了一层图形化界面,把所有原本要手打的命令行参数,变成了直观的复选框、下拉菜单和输入框。只需根据需求在表单界面中进行直观配置即可。点击三次鼠标,就能完成专业打包:选择脚本 → 勾选选项 → 点击转换,平均可节省70%的配置时间。
PakePlus
PakePlus 是一个开源、免费且轻量级的工具,旨在帮助用户将任何网站或前端项目(如HTML、Vue、React)快速打包成跨平台的桌面和移动应用。
Wormhole
wormhole专注于普通用户间安全、私密传输大文件的免费工具网站。无需注册,直接通过浏览器端到端加密分享最大10GB的文件,并生成可设置自动过期的链接。
暂无评论...






