7月底到8月底这一个月,浏览器自动化里「让机器学一遍你操作」这条线,几乎一天一个新闻。
6月下旬,OpenAI 给 Codex 上了 Record&Replay 插件:它不是普通录屏,也不是鼠标宏,而是把一个稳定、重复、可验证的 Mac 工作流沉淀成可复用 skill。哔哩哔哩
8月25日,xAI 给 GrokBuild 加了 BrowserUse 插件,「Coding Agent 都想操作浏览器」的阵营再添一员。知乎
8月26日,Claude in Chrome 正式开放,面向所有 Claude 付费计划可用,把逐步确认改成了自动批准安全动作。知乎
当天小红书上「浏览器 AI 代办」的话题就跟上了盘点:Claude in Chrome 正式全面开放,ChatGPT Work 也上线了已登录网站的任务代办功能。小红书
8月27日,Einsia 开源 Browser-BC,给出的答案是一条三步范式:录制 → 转写成 Skill → 交付执行。知乎
同一天开源的 Browser4 走另一条路,主打「一次 AI 规划,后续全程本地、不烧 LLM Token」。知乎
腾讯开源的 BrowserSkill(bsk CLI + Chrome 扩展)则把「操作录制」在 8 月中旬补成了实测教程:录制结束后,Agent 去读 trace.json,告诉你刚才进了哪些页、点了哪些步骤,下次换个参数照着干。知乎同一时间线上,B站讲 egolite「让 Agent 和人类共用同一个 Chrome」的视频攒下 31.6 万播放、3.5 万收藏,评论区一条高赞把整体气氛说透了:浏览器自动化终于从“能不能做”,进入了“怎么低成本稳定做”的阶段。哔哩哔哩
但圈子的另一头,做 RPA 的老手在同一周的知乎上泼冷水:「只会点击捕获元素的脚本,全是一次性废品」。知乎
同一件「录一遍」的事,大厂在踩踏式进场,老手在嘲讽按键精灵复活。把分歧拆开,核心问题只有一个:不同工具录下来的到底是什么东西——它决定了页面改版后你还剩多少、跑批量任务时账单长什么样、以及三个月后维护它是资产还是负债。
一、四种「录制」,存的根本不是一个东西
把 2026 年市面上所有「你点一遍、机器学着干」的方案按存储物分层,混战的原因就清楚了:
代际 | 代表 | 录下来存的是什么 | 页面改版后 | 换任务参数后 |
|---|---|---|---|---|
坐标层 | 按键精灵、部分 RPA 拖拽录制 | 屏幕坐标+按键序列 | 立刻失效 | 大概率失效 |
选择器层 | Playwright codegen、RPA 捕获元素 | CSS/XPath 选择器+动作序列 | 改版即断 | 勉强能跑 |
轨迹层 | BrowserSkill 录制、Codex Browser Recorder | pages+steps 的操作轨迹 | Agent 读轨迹时能自己纠偏 | 换参数重跑 |
语义层 | Codex Record&Replay、Browser-BC | 自然语言「该做什么、怎么判断做完」 | 语义不变就能举一反三 | 天然适配 |
语义层这一代最关键的设计是主动遗忘。Browser-BC 转写技能卡时把容易坏的东西全部剥掉:精确坐标、DOM 选择器、临时 ID、登录态都不存,只保留「该做什么、怎么判断进展、怎么算完成」。知乎原因很直白:网页天天在变,克隆坐标和选择器极其脆弱,克隆「做什么」才迁移得动。
所以 RPA 老手骂的和 2026 年这波产品赌的,其实是两层东西:前者骂的是选择器层——影刀社区「可视化录制用一段时间就失效」的抱怨,说的正是选择器随页面小改版批量断掉;后者赌的是语义层。两边都没说错,只是不在同一层。真正的进步在于:这一轮所有认真做录制的玩家,都在想办法让存下来的东西离开「当前页面的像素布局」。
二、真正的分水岭:Token 账单怎么算
egolite 视频评论区有条高赞分析说得很工程化:浏览器给 Agent 暴露 CLI 接口比插件更省 token,而且「能通过 skill 和脚本形成固化的插件,类似油猴那种,能脱离 ai 运行」。哔哩哔哩这句话把三条路线的成本模型点破了:
逐步 LLM 驱动(browser-use 类):每一步都让模型「看页面再决定」。Browser4 原文把账算得很清楚:靠 LLM 逐页读页面的方案,Token 成本随页数线性放大,而一次规划本地重放的路径从单页到十万页都不烧 Token。知乎跑批量采集、批量填单,这条路的账最快见顶。
一次演示 + 确定性重放:Playwright codegen 和影刀录制是旧答案,Browser4 是新答案——人先演示,机器沉淀成不依赖模型的执行物,之后每次执行的成本约等于电费。
蒸馏技能 + 便宜模型执行:Browser-BC 的主张是「技能从哪来」和「由谁执行」彻底分开——人做一遍转成技能卡之后,照着干可以换一个更小、更便宜的模型。开发成本摊薄到一次演示,执行成本降一个数量级。
但要泼一盆冷水:实测党对这类工具最常见的抱怨是「只适合2-3步的简单任务,一旦指令稍微复杂,执行任务就很慢,而且一直卡在关键步骤反复横跳」。哔哩哔哩Agent 每横跳一次,烧的都是真金白银的 token——可靠性没兑现之前,「省开发成本」可能只是把成本挪到了执行账单和值班表上。复杂流程现阶段仍然要人写骨架,录制负责沉淀的是外围固定段。
三、大厂敢放「自动执行」,靠的是把检查塞进执行路径
Claude in Chrome 敢把逐步确认改成自动批准,公开的架构是一条三层防线:模型先在训练中学习抵抗提示注入,探针再检查网页等工具结果,动作分类器最后核对每次点击和输入是否符合用户最初的请求。知乎
底气之外也写着风险:官方红队评测里,攻击到达模型后、在没有额外防护时,Opus 4.5 的攻击成功率为 17.6%,Opus 5 为 3.8%。知乎
数字降了,但页面提示注入没有被清零——这就是每一个准备把自动化挂到登录态上的人,都该抄走官方那个自检问题的原因:如果这个动作做错了,能否在几分钟内无损撤回?知乎整理标签页、摘录报表可逆;发送、转账、最终提交不可逆——不可逆的那半截,留给人。
BrowserSkill 走的是同一原则的另一种实现:遇到验证码、支付确认、二次验证等必须人工处理的步骤时,Agent 会主动暂停并弹窗请求你介入,处理完后继续执行。知乎两条路线殊途同归:自动化的边界不在「能不能点」,在「点错了谁负责收尾」。
四、按场景对号入座,以及别抱幻想的边界
测试团队的 CI/CD:继续 Playwright,codegen 只当脚本生成器用。BrowserSkill 这类强绑定「本机已登录 Chrome/Edge + 可见窗口」的方案,做不了无头 CI 和跨浏览器兼容——评测作者自己也承认,纯无头的服务端自动化对它是硬伤。知乎
Mac 个人用户的固定流程:Codex Record&Replay 是当下完成度最高的「演示一遍」,但注意现阶段仅限 Mac——上线首日 B站教程标题就写着「【仅限Mac】」,评论区「没有 Windows 版,白看了」也是 egolite 那条 31.6 万播放视频下最高频的抱怨。哔哩哔哩
要进没有 API 的后台:内部仪表盘、遗留系统、供应商门户,这正是 Claude 官方点名的价值场景——过去要等接口、写适配器,现在页面本身就是入口。代价是权限边界必须自己划。
批量采集/结构化抽取:走「一次规划 + 本地重放」路线,别用逐步 LLM 读页烧 token;选择器维护交给蒸馏层,别把 XPath 当资产。
财务/电商运营的 RPA 场景:影刀社区的选型老话仍然成立——先看功能列表不如「先拔了网线再测」,内网连通性和数据落地位置不过关,拖拽组件再多也是零。知乎
五、接下来三个月盯什么
技能库治理会不会变成新的维护地狱。Browser-BC 已经在用技能图管库:新技能来了,判断是新增(add)、合并(merge)还是登记为某个更通用技能的特化(specialize)。知乎录出来的 skill 多了之后,谁来查重、谁来废弃——这是选择器地狱之后的第二代维护问题。
Firefox、Safari 有没有人跟进「复用已登录浏览器」这条路线;以及 Chrome 扩展的政策风险怎么对冲——BrowserSkill 的评测已经点名:理论上扩展可能因政策调整被下架,官方目前没给侧载教程。知乎
Record&Replay 什么时候开放 Windows——这条不解决,「录一遍」在国内以 Windows 为主的企业办公场景里就只是 Mac 用户的玩具。
技能执行出了事故,责任链怎么归。技能卡是自然语言写的,执行的是另一个模型,出了错既难定位到「哪一行」,也难复现——现在没有任何一家给出答案。
「录一遍就会」不是按键精灵复活,也不是终点答案。它真正改掉的是自动化的成本结构:开发时演示一遍,执行时按语义重放,改版时死得比以前慢。但死得慢不等于不死——三个月后回头清点你录的那批 skill 还活着几个,比现在听任何一场发布会都有说服力。