文章

Public Browser 3.0:浏览器 MCP 能不能少烧 Token

静水流深 3小时前 · 1,229 字 · 约 4 分钟 · 12 次阅读
我发布了文章:《Public Browser 3.0:浏览器 MCP 能不能少烧 Token》

让 AI 操作浏览器,最贵的不一定是页面本身,而是反复“读取页面—执行一步—再读页面”的工具调用。Public Browser 3.0 想解决的正是这个问题:它通过 CDP 直接控制真实 Chrome,用可访问性树给页面元素分配引用,并允许 run_plan 在一次调用中连续执行多步操作,减少模型反复读取上下文的次数。

项目采用 MIT 许可证,没有付费档,可作为 Claude Code、Cursor 及其他支持 stdio MCP 的客户端工具,也提供 Node 和 Python 接口。准备试用时先确认 Node.js 20 或更高版本,然后按项目主页给出的命令添加到 Claude Code:

claude mcp add --scope user public-browser -- npx -y public-browser@latest

添加后要完整退出并重新打开 Claude Code,只执行 MCP 重连还不够。默认启动的是一个新的临时 Chrome 配置,没有 Cookie、登录状态和扩展,这反而适合第一次测试:先让它完成公开页面的信息提取、表单填写、多标签切换和下载等低风险任务,不要一上来就把常用管理后台和主账号交给它。

跑分可以参考,但不能直接当成结论

作者在自己的 30 项测试页上,用 Claude Code 2.1.281、Opus 5 和 Chrome 153 各跑五次。Public Browser 3.0 五次均完成 30 项,中位数为 79 次工具调用、302 万会话 Token 和 261 秒;agent-browser 0.38.1 为 104 次调用、453 万 Token 和 386 秒,并固定漏掉一个 navigator.webdriver 检查。

这组结果说明“合并步骤与缩短返回内容可能省调用成本”,但测试页、工具和数据都由项目作者维护,目前没有独立复测,不能外推到登录复杂、验证码密集或大量文件上传的真实后台。更可靠的选型方法,是挑选自己每天都会做的 5 到 10 个任务,让现有工具与 Public Browser 分别执行,记录完成率、人工接管次数、总耗时和模型账单,再决定是否迁移。

升级和真实浏览器配置有两个坑

3.0 要求服务器与 Python 客户端一起升级:publicbrowser 2.0.0 对应 Public Browser 3.0.0,旧版 Python 客户端会因为缺少新的访问密钥而连接失败。使用真实 Chrome 配置时,macOS 上普通网站的登录 Cookie 目前不会随配置带入;Linux 和 Windows 的这一行为尚未验证。真实配置默认通过调试管道控制,不开放固定调试端口,但如果 Chrome 拒绝管道,程序可能退回随机端口并发出警告。

因此,这个工具目前最适合愿意自己做对照测试、重视 MCP 调用轮次,并能为自动化准备独立浏览器配置的站长。需要稳定复用登录、录制 HAR、保存视频或操作 iOS Safari 时,项目自己也承认 agent-browser 的能力更完整,不必为了跑分强行更换。

登录 后参与评论

还没有人评论,来抢沙发