8月,腾讯开源了一个小工具,开发者圈罕见地热闹了一下。2026 年 8 月,腾讯悄然开源了 BrowserSkill —— 一套让 AI Agent 直接操作你已登录浏览器的 Rust CLI + 浏览器扩展方案。知乎但有个值得注意的细节:这个仓库其实在 6 月下旬就注册了 GitHub,讨论热度直到 8 月才真正爆发。我们顺手查了微信公众号、头条、36氪、钛媒体,结果全是 0 条——它仍停留在"开发者先上手"的阶段,还没破圈。如果你平时已经在用 Cursor、Claude Code 这类编程智能体,正犹豫要不要装,这篇就是写给你的:它能干什么、哪三类人先别装,以及"让 AI 操作浏览器"的几条路线该怎么选。
它解决的是什么:AI 会写代码,但打不开"你登录过的页面"
现在的智能体能写代码、读文档,可一旦遇到需要登录的页面就基本歇菜——订机票、查收件箱、操作公司后台,全卡在登录态上。传统路子只有两条:自己写 Playwright 脚本维护登录流程,脆弱还容易跪在验证码上;或者把账号密码交给 Agent,安全隐患不小。BrowserSkill 走的是第三条路:它在你本机的 Chrome/Edge 浏览器与 AI Agent(Cursor、Claude Code、Codex、WorkBuddy 等)之间建立安全通信链路,让 Agent 在一个独立可见的 Agent Window 中操作网页,同时直接复用你浏览器已有的登录态(Cookie、Session),无需额外配置账号密码。知乎整条链路是这样的:Agent 框架通过 Shell 调用 bsk CLI,CLI 经 IPC 与本地 Rust 守护进程通信,守护进程再用 WebSocket 连上浏览器扩展,由扩展在浏览器里开出一个独立的 Agent Window。窗口带橙色高亮边框,一眼就能认出"AI 正在动手"。遇到验证码、支付确认、二次验证这类必须人工处理的步骤,Agent 会主动暂停请求接管,你处理完它再继续——它不抢你正在用的浏览器。

上手门槛也足够低。以前想让 AI 操作网页,你得是"全栈程序员"——会写 Playwright、懂 Chrome DevTools Protocol、能调 CDP 接口。现在 3 行命令,10 分钟搞定。知乎具体操作:Node.js 18+ 环境下 `npm install -g @tencent/browserskill` 全局安装,`bsk --version` 验证,`bsk install-skill` 勾选你的 Agent 框架,最后去 Chrome 商店装上 BrowserSkill 扩展。官方已预置 Cursor、Claude Code、Codex、OpenClaw、CodeBuddy、WorkBuddy、Pi、Hermes 等主流框架的 skill 模板。
实际稳不稳:看一个真实账号实测
B站已经有完整的实测视频:UP 主用自己的真实账号,从安装连接开始,验证了登录态复用、任务运行是否影响正常用浏览器、需确认时能否通知三件事,随后让它进入抖音后台获取评论,最终得到 203 条。过程中它点错过一次,又重新读取页面代码找回入口;视频保留了成功、出错和恢复的完整过程,作者强调只代表这次个人环境,不延伸为通用性能或安全结论。哔哩哔哩这种态度值得借鉴:早期工具的实测可以当参考,但别直接外推成结论。
但这三类人,先别急着装
第一类:做无头、服务端自动化的。 BrowserSkill 的设计哲学就是"可见可控",Agent Window 正是安全感的来源,所以它没有无头模式,也不适合 Docker、无桌面环境。CI 里的 E2E 测试、7×24 小时数据采集,仍是 Playwright 的主场。
第二类:主力浏览器是 Firefox、Safari,或装不了商店扩展的。 官方运行时支持表写得很清楚:Chrome and Microsoft Edge are supported; other Chromium-based browsers are expected to work when they support unpacked Chromium extensions; Firefox is planned。GitHubSafari 连时间表都没有。同时整套方案强依赖 Chrome Web Store 上的扩展,理论上存在因政策调整被下架的可能,官方目前也没给侧载教程——如果你的公司设备管控装不了商店扩展,这条路走不通。
第三类:企业安全环境,以及不想碰早期生态的。 浏览器扩展需要较高权限才能操作网页,登录态又是最敏感的部分,登录态越真,权限边界越要看清。哔哩哔哩腾讯声明不做遥测、不走外网,但安装扩展本身就是信任行为,企业落地要先过安全审计。生态方面,截至 2026 年 8 月,GitHub Star 约 900+,社区贡献者有限,相比于 Playwright(68k+ Star)和 browser-use(95k+ Star),生态差距明显。知乎不过增速不算慢:我们 8 月 17 日查 GitHub API 时,stars 已涨到 1111、fork 91,仓库仍在持续推送。早期玩家吃红利,也要接受文档不全、issue 没人秒回的成本。
四条路线,一次说清
先把形态分类摆正:一句话概括形态:browser-use 是"库",ego-lite 是"专用浏览器 App",BrowserOS 是"浏览器全家桶"。知乎再加上 BrowserSkill 这类本地桥接,正好凑成四条路线。
路线一:本地桥接(BrowserSkill、BrowserOS neo)。 不自带浏览器,而是"借用"你日常在用的真浏览器,登录态天然继承,安装成本最低。适合想让现有 Agent 直接操作已登录页面的人。BrowserSkill 是目前这条路线最完整的开源实现,MIT 许可。
路线二:Agent 库(browser-use)。 browser-use 是 2025 年以来最火的 AI 浏览器 Agent 框架(GitHub 95k+ Star,获 Felicis 领投 1700 万美元种子轮)。知乎官网现在的主打口径已经是托管服务:82% on Internal Bench Hard at 17¢ per solved task, $0.02 per browser hour。browser-use 官网OSS 版原本用 Playwright 启动独立 Chromium,v0.6.0 起移除 Playwright 依赖、改用自研 cdp-use;Cloud 版可通过 Profile Sync 把本机 Chrome Session 同步到云端,代价是要掂量数据出境的边界。
还有一处数据打架:另一篇横向对比文把它的 stars 记为 108k(数据采集时间 2026-08-08),与评测文的 95k+ 对不上,但双方都认可它是本赛道社区最大的项目。知乎

看 browser-use 官方放出的 BU Bench V1:Cloud(托管)版最佳模型准确率 85%,OSS(自部署开源)版最佳为 74%,差了约 11 个百分点。追求成功率又不想自己调环境,托管版目前就是比自部署强一截——这也是它敢按任务收费的底气。
路线三:AI 原生浏览器(ego-lite、BrowserOS)。 不借浏览器,直接为 Agent 造一个浏览器。ego-lite 官方 README 给出了一份基准对比:We benchmarked ego lite against Vercel’s agent-browser on four complex browser automation tasks. ego lite finished each task up to 2.5× faster, with substantially fewer tokens。GitHub

官方对比图里差距最大的一项,耗时是 226 秒对 87 秒(约 2.6 倍);Expedia 订机票任务中,agent-browser 被反爬拦截,ego-lite 完成。注意这是官方自报数据,对比对象是 Vercel 的 agent-browser 而非 browser-use。ego-lite 采用 MIT 许可、GitHub 1.15 万+ stars,但目前只支持 macOS,Windows 和 Linux 还在路线图上。BrowserOS 是三者中唯一 fork Chromium 的项目,同时做日常浏览器和 Agent 专用副浏览器 neo,功能最全,但 AGPL-3.0 对闭源商用是个约束。
路线四:自组直连(CDP/MCP)。 想要完全掌控,直接走 CDP 永远是一条路:Google 的 chrome-devtools-mcp(约 4.9 万 stars)和微软的 playwright-mcp(约 3.6 万 stars)都是现成的 MCP 实现。这条路不依赖任何人的扩展,但登录态和反爬都得自己解决,适合本来就要写自动化代码的人。
怎么选,以及接下来盯什么
那篇对比文的结论可以直接当选型基线:选型上:写代码做自动化选 browser-use;用代理操作已登录的真实账号选 ego-lite 或 BrowserOS neo;想换日常浏览器选 BrowserOS。知乎我的补充是:如果你日常已在用 Coding Agent,只是想偶尔让它帮你操作后台、查订单这类"不登录打不开"的页面,BrowserSkill 是当下试错成本最低的——三条命令装完,不合适就卸载删扩展,十分钟的事。
接下来值得盯的信号:
腾讯会不会上架 Edge 商店、是否给出官方侧载教程,这决定国内 Windows 场景的上限;
Firefox 支持和无头模式会不会进路线图,这决定它能否从桌面工具走向生产环境;
stars 与 issue 响应速度的变化,半个月从 900+ 涨到 1100+ 不算慢,但生态能不能立住要看维护;
browser-use Cloud 的按任务计费会不会继续降价,它直接影响开源自部署方案的吸引力。
"Agent + 真实登录态"这个方向没有悬念,真正的问题是走谁家的桥、门由谁来守。如果你已经装上了,评论区聊聊:你让 AI 用你的登录态干的第一个活是什么?