OpenAI宣称智能体能"熟练操作电脑":给你的Agent装手之前,先看这三个生产环境坎

源自35位全网作者

09:49

8月20日,智能体圈被两条消息同时刷屏。

一条来自OpenAI。据IT之家报道,OpenAI宣称AI智能体已经可以"熟练操作电脑"——最新模型从训练初期到后期的各个阶段,都加入了专门提升电脑操作能力的数据和训练流程,不是事后打补丁,而是从底层就为"动手"设计的。知乎同一天知乎上了两个相关热榜问题,一位参与开发电脑操作智能体基准测试的哥伦比亚大学研究员解释,这类训练是在通用模型已有能力之上继续强化。

另一条来自国内桌面智能体战场,就发生在这几天:豆包"虚拟桌面"8月18日上线Windows端,纯GUI视觉识别,不依赖API和MCP,直接在独立沙盒里模拟键鼠;百度搭子7月月活674.3万,环比涨了1063.79%;千问办公8月3日开启公测,腾讯WorkBuddy月访问量2097万领跑全赛道——按文中引用的易观数据,今年6月国内PC端AI原生办公智能体市场总访问量已经突破6062万次。知乎

表面上看,这是又一轮"AI替你动手"的热闹。但如果你是那个真的在写Agent、想让它在生产环境里干活的开发者,这一波对你的意义不太一样:"给智能体装上手"这件事本身,已经不是门槛了;让这双手稳定干活,才是。

翻了翻最近知乎、B站、36氪上的讨论,我发现真正在生产环境里踩坑的开发者,纠结的几乎都不是"模型够不够聪明",而是三笔很不性感的账。

第一笔账:进不去

很多人对电脑操作/浏览器操作Agent的印象,还停留在Demo:智能体打开页面、点按钮、填表单,一气呵成。但Demo环境是受控页面、单线程、没有防御;真实互联网不是。

最近知乎上一篇热度很高的长文给了一组数据(先声明:该文出自网页数据服务商视角,具体数字建议谨慎采信,但它描述的问题在开发者社区里是普遍共识):一个没做任何反爬配置的"裸"浏览器智能体——就是直接用Playwright或Puppeteer拉起的自动化浏览器实例——在主流电商网站上的平均存活时间不到15分钟;某些社交平台甚至能在前5个请求内就识别并拦截。知乎它面对的是分层防御:最外层是WAF,看TLS指纹、HTTP头特征和IP信誉;中间层是行为分析,追踪鼠标轨迹、点击间隔、页面停留时间;最内层是浏览器指纹和验证码。自动化脚本那些"标准动作"——精确到毫秒的点击间隔、完美线性的鼠标移动——在统计意义上恰恰是最显眼的破绽。

OpenAI宣称智能体能

你的Agent从"Demo里打开三个网页"变成"持续访问成百上千个页面"时,摔的第一跤往往就在这里。

第二笔账:读不懂

进去了,第二个问题来了:怎么把页面变成Agent能用的结构化数据。

现代网页的DOM动辄几千个节点,真正有用的信息可能不到5%,其余是导航栏、推荐位、广告、埋点脚本。传统做法用CSS选择器或XPath定位元素,但这套东西极其脆弱——按上面那篇长文的统计,100个目标网站里,平均每个月有12%到15%会发生让提取规则失效的页面结构变化。知乎你维护100个站的提取规则,每个月就得修12到15个,而且这个负担不会随时间减少。

电脑操作型Agent还多一层难:它执行任务时可能动态访问完全陌生的网站,压根不存在"预先配置好的提取规则",需要的是自适应任意页面结构的提取能力。这不是"脚本写得仔细一点"能解决的问题,而是另一种工程能力。

第三笔账:跑不起,也算不清

第三笔最隐蔽,是成本。分明账和暗账两种。

明账是基础设施的钱。那篇长文里有个真实案例:一个跨境电商团队要监控5000个SKU在Amazon、Walmart、Target上的竞品价格,自建了50个Playwright实例的采集集群——每月代理费约8000美元,采集成功率在70%到85%之间波动,Amazon每两三周更新一次反爬策略,整个集群就要瘫痪48到72小时等工程师救火。文章估算,一套企业级网页数据采集基础设施的年维护成本(人力+服务器+代理+带宽)通常在50万到200万美元之间。知乎具体数字见仁见智,但方向是确定的:规模化本身就是一门独立的学问。

OpenAI宣称智能体能

B站这周有条3万播放的视频,标题很直观:《烧了4亿Token,就为了让长辈用智能手机轻松点》。哔哩哔哩做一个给长辈用的手机辅助Agent,token消耗就能以亿计——生产环境的账单和Demo阶段的账单,根本不是同一个物种。

暗账是token计费本身。8月19日,OpenAI Codex负责人Tibo捅破了一层很多人忽略的窗户纸:同一段文本,GPT-5.6 Sol的分词器切出766个token,Claude Opus 5的估算是1170个,差了34.5%——而两家的输入单价都是每百万token 5美元。36氪他的比喻很妙:两张一样的披萨,一家切8块,一家切16块,第二家单块标价更低,但整张吃下来反而更贵。“你的胃并不关心你刚才吃了几块。”

坑还不止这一个。Anthropic官方文档写得明白:Claude 4.7之后的模型换了新分词器,同样文本的token数比早期模型大约多30%,旧模型上量出来的计数别直接复用。缓存价差也很大:GPT-5.6 Sol缓存输入0.5美元/百万token,只有标准价的十分之一;但输出端是30美元/百万token起,而真实Agent工作流里输出token的权重往往比输入更狠——前面靠分词效率省下的34.5%,很可能在输出端吐回去。最隐蔽的一条写在GPT-5.6 Sol官方定价页的小字里:输入超过272K token时,整次请求的输入按2倍计价、输出按1.5倍——不是超出部分加价,是整个请求换档。36氪同一段代码,在27万token的上下文里问和在28万token的上下文里问,单价就不一样。

OpenAI宣称智能体能

这些数字拼起来意味着:如果你还在拿"每百万token单价对比表"估算Agent的月度成本,那笔账从第一天起就可能偏差三成以上,而且调用量越大、偏差越疼。

这波大战真正在卷的,是模型之外的那层

把三笔账放在一起,会发现它们指向同一件事:电脑操作Agent从Demo到生产,缺的从来不是模型智商,而是模型之外那整套可靠性基础设施——行业现在管它叫Harness。今年3月,LangChain把这层关系总结成了一个公式:Agent = Model + Harness。知乎模型决定能力上限,驾驭层决定能力能不能变成稳定交付。

OpenAI宣称智能体能

事实上,这周的混战已经在朝这个方向投票了:Playwright从开发者测试工具变成AI网页自动化的核心基础设施;豆包虚拟桌面先立沙盒再谈键鼠模拟;DeepSeek Harness开发者预览版8月13日发布,5天拿下近15万GitHub Star——大家抢的早就不只是"谁的模型会操作电脑",而是"谁的执行稳定、可控、可审计"。知乎

36氪这周编译的一篇文章里有句话说得挺狠:智能体的"死循环"——反复自我调用、自我修正——只是一张"止血贴",掩盖的是"几乎没人能成功写出有效提示词"、任务从一开始就没交代清楚的事实。36氪Token消耗不是生产力,评估标准(evals)才是。那篇文章给了个判断:如今99%的AI营收来自编程,就是因为代码只有跑通和跑不通两种状态,自带评估标准;其他领域什么时候能定义清楚"什么叫做完了",Agent什么时候才谈得上创造价值。

动手之前,先回答三个问题

如果你正打算给自己的Agent"装手",建议先回答这三个问题:

第一,这个任务值不值得上基础设施。 一次性、低频、可容错的任务——比如一周订一次餐厅、填一张固定表单——裸Agent加人工兜底就够了,别过度工程化;高频、大规模、对成功率有硬要求的任务——比价监控、知识库保鲜、批量处理——先把上面三笔账做进预算,再动手。

第二,你怎么定义"做完了"。 写Agent之前先写evals。没有评估标准,你的Agent"成功"与否永远是感觉,成本优化也无从下手。评估套件会越来越像团队的核心资产,因为没有一个通用eval能适配你的业务。

第三,哪层自建,哪层外包。 原则一句话:产生差异化的层自建——任务编排、业务判断、评估标准;对抗全互联网的层外包——反爬、渲染、代理池。真需要大规模网页访问,现在行业里已有托管网页访问层这类服务,把反爬、渲染、结构化封装成API;但提醒一句,这个方向不少案例数据出自厂商自己的文章,成功率和投入产出比的数字,建议打个折扣听。

至于成本,给个实操建议:别看单价表。拿你的真实工作负载,在候选模型上各跑一遍,直接对比返回的input/output token数,再看缓存命中率和输出占比——官方自己都建议这么干。另外值得留个信号:Tibo说,计费的下一个单位可能是"每次成功"。真到那一天,Agent的成本账会整个重写,早一点把eval跑起来的人,账本切换的成本最低。

这一波电脑操作Agent的热闹,Demo层面的胜负已经定了。真正的下半场在生产环境里:进不进得去、读不读得懂、跑不跑得起、算不算得清。OpenAI那句"熟练操作电脑"可以当成这个方向的入场券来看——但真动手之前,先把这几个不性感的问题答完。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章