OpenAI开始向客户开放「AI操作电脑」:让ChatGPT替你干活之前,先算清三笔账

源自122位全网作者

08:57

砍掉浏览器 11 天后,OpenAI 把「AI 操作电脑」推到了台前

8 月 20 日,#OpenAI终极野心曝光# 冲上微博热搜。据《商业内幕》报道(IT之家转引),OpenAI 员工乐观估计,公司正接近实现从创立之初就设定的目标:让 AI 智能体像人类一样熟练地操作电脑,尤其是使用浏览器。更关键的是后半句:经过多年开发,公司现在已经有信心开始向客户逐步开放电脑操作功能。微博

对关注 Web 自动化的人来说,这条新闻的正确打开方式不是「又一个 AI 大新闻」,而是把它和 11 天前的另一件事拼起来看:8 月 9 日,OpenAI 刚关掉了自研 AI 浏览器 Atlas。前脚砍浏览器,后脚开放「操作电脑」,这不是撤退,是换路线。

Atlas 的 292 天:路线输了,能力没死

先把时间线捋清楚。Atlas 从 2025 年 10 月 21 日发布,到 2026 年 8 月 9 日停止工作,一共存在了 292 天。机器之心为了推广自家 AI 浏览器,OpenAI 还曾用赠送 ChatGPT 额度的方式推销。极客公园

OpenAI开始向客户开放「AI操作电脑」:让ChatGPT替你干活之前,先算清三笔账

但它始终只有 macOS 版。2026 年 7 月 9 日,OpenAI 宣布 Atlas 下线,给了约 30 天迁移期;帮助文档里留给用户的最后一条指引,是请在 8 月 9 日之前,把书签导出为 HTML 文件。极客公园一家想重新发明浏览器的公司,教用户的最后一件事,是怎么搬回 Chrome。

Atlas 真正的价值不在壳,而在里面的 Agent Mode:打开标签页、点击、输入,执行购物、预约、研究等多步骤任务。机器之心这些能力没有随产品下葬——它们被拆成两份:一份进了 ChatGPT 桌面端,包括那个能替你操作网页的云端浏览器;另一份做成了 Chrome 扩展。极客公园

OpenAI开始向客户开放「AI操作电脑」:让ChatGPT替你干活之前,先算清三笔账

关停公告里有句话,现在看就是这次转向的注脚:AI 浏览器应该是一个功能,不是目的地。极客公园所以 8 月 20 日这篇报道说的「逐步开放电脑操作」,不是新故事,是 Atlas 的遗产正式走到台前。

底气从哪来:从「看截图」到「读网页」

报道披露的技术细节,信息量不小。在最初的大规模基础训练阶段,OpenAI 很可能加入了逐帧屏幕截图,让模型提前接触有助于电脑操作的信息,后续阶段再用真人示范和强化学习继续加码。微博

更关键的变化是「看」的方式。过去 ChatGPT 要反复截取屏幕、分析像素、发送操作指令,再重新截屏分析;而目前在打开网站后,系统可以直接快速读取网页的底层信息,从内存结构、无障碍信息到链接关系都能应对。微博这一步等于从「盯着屏幕猜」换成「直接读页面结构」,也是整条技术路线里最值得内行盯住的一句。

截图并没有退出流程:用户开启电脑操作功能时,需要允许 ChatGPT 录屏,以便系统迅速识别当前显示的内容。微博这些能力组合起来,Codex 已经能自行测试生成的代码、发现问题并继续修改,形成完整闭环。电脑操作团队经理韦恩斯坦的说法很直接:一旦 ChatGPT 操作电脑和软件的速度超过你我,就会改变人们默认与电脑交互的方式。

社区里的基准复盘也印证了这条能力曲线。OSWorld-Verified 榜单上可以看到,在 2025 年底出现了一个能力的跃升,那段时间刚好是 Atlas 推出之后;BrowseComp 能力方面,也是在 2026 年初出现质的提升。知乎

OpenAI开始向客户开放「AI操作电脑」:让ChatGPT替你干活之前,先算清三笔账

泼盆冷水:能力边界比宣传清楚

先别急着想象「明天就能躺平」。参与开发热门电脑操作基准的哥伦比亚大学研究员周宇说得很直白:在训练数据非常充足的有限领域,电脑操作智能体确实可以表现得很好。想让它适应任何网页、任何应用程序和任何操作系统,仍然非常困难。微博

落到具体用例上,目前披露的场景集中在数据录入、合规任务和日程安排这类规则明确的窄任务,外加一批本来为人类点击和输入设计的「长尾网站」。微博批量回复邮件还做不到,浏览社交媒体信息流时也偏慢。

速度同样是硬伤。The Verge 早期测试 Atlas 时,一次 Amazon 加购任务,Atlas 大约耗时 10 分钟,而同一测试里的 Perplexity Comet 约为 2 分钟。机器之心而且只要任务流程变长,Agent 往往仍然需要用户持续检查和干预。

开启之前,先算三笔账

站在值不值得开的角度,这笔账可以拆成三份:

第一笔是隐私账。开启电脑操作要允许录屏,屏幕上出现的一切都在系统视野里;agent 还可能在你的登录态页面上执行操作。工作内容敏感的人,这一票要谨慎投。

第二笔是权限账。奥尔特曼 2025 年就示警过:实用价值很大,潜在风险也同样不小,建议只向智能体提供完成任务所必需的最低权限。微博

OpenAI 目前的确认策略是:只要智能体准备向外传输数据或者删除内容,就必须先征得用户同意。微博

这条防线不是多余的。2026 年 Black Hat 前夕,安全公司 Zenity 的研究仍然能够诱导部分 AI 浏览产品操作登录状态下的 WhatsApp 和 Amazon 页面,而 OpenAI 自己早就承认,这类把恶意指令藏进网页的提示注入攻击无法被完全阻止。机器之心

第三笔是时间账。负责浏览器能力的詹姆斯·孙说,对很多工程师来说,现在已经是让智能体写代码比自己写更快,电脑操作希望最终接近这种效率。微博注意时态:那是目标,不是现状,现在加一次购物车还要 10 分钟。

等不及的话,现在有什么能用

想现在就体验「AI 替你在网页上干活」,选择其实不少:

  • Perplexity 的 Comet 已经干脆向所有用户免费开放,本质是给订阅主业获客。极客公园

  • 存量浏览器依然是基本盘:StatCounter 数据显示,2026 年 6 月,Chrome 在全球桌面及移动浏览器市场的份额仍为 70.01%,到 7 月仍是 68.22%。市值榜机器之心

  • 巨头都在往存量浏览器里塞 AI:Gemini 进了 Chrome,Edge 里的 Copilot 模式同期铺开。ChatGPT 自己也做成了 Chrome 扩展,Chrome 商店页面显示的用户数已达 300 万。

  • 国内阵营:腾讯把 QQ 浏览器升级为 AI 浏览器并推出 QBot,接入混元和 DeepSeek 双模型;360 全系浏览器做了 AI 升级,夸克持续强化 AI 搜索。

  • 高频网页干活的人可以多留意美团旗下的 Tabbit:它把浏览、搜索、对话和 Agent 执行放进同一个工作区,已有跨境电商从业者用它编排覆盖经营链路的自动化任务,也有学生用它批量整理论文。

  • 至于确定性重复任务——每日签到、固定格式抓取、批量填表——影刀这类成熟 RPA 工具依然比大模型 agent 更稳,至少不会自由发挥。

OpenAI开始向客户开放「AI操作电脑」:让ChatGPT替你干活之前,先算清三笔账

值得盯的三个信号

这条新闻发酵还不到一天,社区讨论还集中在转载层面,先不急着下强判断。三个信号值得标记跟进:

  1. 开放范围:电脑操作功能先给哪批客户、哪些地区,会不会进 ChatGPT 消费级——这决定它跟你有没有关系;

  2. 确认策略的最终形态:一个任务弹几次授权、哪些动作必须人工点头,直接决定它是生产力还是弹窗地狱;

  3. 国内跟进:国产大模型的 computer-use 进展和浏览器厂商的 agent 化。支付这块拼图也在动——x402 协议已被正式捐给 Linux 基金会,谷歌、微软、Visa、万事达等 40 多家机构进场共同治理;国内这边,支付宝 AI-Pay 也被封装成了 MCP 工具,代理可以下单、唤起支付,但最后一步收银台仍由人点头。知乎

一句话收尾

浏览器之战结束了,「谁替你干活」的战争刚开始。不用为 AI 搬家:浏览器照用,插件装好,权限攥紧——等信号对齐,再让它开工。

精选参考来源

1
【#OpenAI终极野心曝光#】据《商业内幕》今天(20 日)报道,OpenAI 员工乐观估计,公司正接近实现从创立之初就设定的目标:让 AI 智能体像人类一样熟练地操作电脑,尤其是使用浏览器。自 2015 年成立以来,OpenAI 一直希望实现这一能力,最大的难题之一是获得足够的训练数据。经过多年开发,公司现在已经有信心开始向客户逐步开放电脑操作功能。OpenAI 电脑操作团队经理阿里 · 韦恩斯坦指出:“一旦 ChatGPT 操作电脑和软件的速度超过你我,就会改变人们默认与电脑交互的方式。”OpenAI 最新模型从训练初期到后期的各个阶段,都加入了专门提升电脑操作能力的数据和训练流程。参与开发热门电脑操作智能体基准测试的哥伦比亚大学 AI 研究员周宇(音译)解释称,这些训练是在通用 AI 模型已有能力之上继续强化,让模型学会完成更多电脑任务。在最初的大规模基础训练阶段,OpenAI 很可能加入了逐帧屏幕截图,让模型提前接触有助于电脑操作的信息。进入后续训练阶段后,开发人员会向模型展示完成特定任务所需的正确操作。例如,要得到填写完毕的税务表格,或者完成一个物体的 3D 模型,就需要让模型学习对应的一系列电脑操作。其中一部分训练数据来自真人示范。OpenAI 公布 2025 年版电脑操作功能时曾透露,公司使用过由人类演示任务完成过程的数据集,但没有透露最新训练数据的具体情况。周宇指出,这类数据很昂贵,因为获取困难,整理成能够直接用于训练的形式也需要大量工作。OpenAI 很可能还利用强化学习继续提高模型的电脑操作能力,让模型反复尝试虚拟任务,并奖励成功完成任务的行为。周宇认为,模型可以学会更多执行这些“获得过奖励的操作”。OpenAI 也改变了模型实际操作电脑时获取信息的方式。韦恩斯坦表示,过去 ChatGPT 需要反复截取屏幕、分析像素、发送操作指令,再重新截屏分析。而目前在打开网站后,系统可以直接快速读取网页的底层信息,从内存结构、无障碍信息到链接关系都能应对。屏幕截图仍然是工作流程的一部分。用户开启电脑操作功能时,需要允许 ChatGPT 录屏,以便系统迅速识别当前显示的内容。韦恩斯坦表示,这些能力结合后,Codex 就能自行测试生成的代码、发现问题并继续修改,形成“完整闭环”。韦恩斯坦和负责 OpenAI 浏览器能力的詹姆斯 · 孙认为,电脑操作技术的一大价值,是让 ChatGPT 智能体能够进入互联网中大量彼此独立的服务和“长尾”网站。从预约网站、企业内部库存系统到社媒平台,许多在线工具起初就是为人类手动点击和输入而设计的。两人透露,已经有用户利用电脑操作功能自动处理数据录入、合规任务和日程安排。韦恩斯坦指出,OpenAI 模型能力提高后,也越来越能主动发现错误并自行修正,因此更容易把任务做完,也更不容易在网络环境中被无关内容带偏。周宇认为,目前电脑操作技术的速度距离普通消费者期待的水平仍有明显差距。“在训练数据非常充足的有限领域,电脑操作智能体确实可以表现得很好。想让它适应任何网页、任何应用程序和任何操作系统,仍然非常困难。”目前,电脑操作功能还不能迅速批量处理邮件回复,浏览社交媒体信息流时也显得较为迟缓。詹姆斯 · 孙和韦恩斯坦希望,随着 OpenAI 模型继续升级,电脑操作最终能够达到 AI 编程目前的效率,让 AI 直接操作网络工具比用户亲自动手更快。詹姆斯 · 孙表示:“对很多工程师来说,现在已经是让智能体写代码比自己写更快。根本不用权衡,直接让它做就行。我认为电脑操作以后也会越来越接近这种状态。”2025 年,OpenAI CEO 萨姆 · 奥尔特曼谈到早期电脑操作功能时曾公开示警:“实用价值很大,潜在风险也同样不小。我们建议只向智能体提供完成任务所必需的最低权限,以降低隐私和安全风险。”詹姆斯 · 孙表示,OpenAI 一直在研究“确认策略”,也就是 AI 执行下一步操作前,究竟应该在什么情况下向用户请求授权。目前的原则是,只要智能体准备向外传输数据或者删除内容,就必须先征得用户同意。网络工作往往需要连续快速地做出决定,因此 OpenAI 仍在寻找易用性和安全性之间的平衡。他坦言:“你可以把某个东西做到 100% 安全,但那样就非常非常难用了。也可以把它做得非常容易使用,但同时非常危险。所以我们真正想解决的问题,是如何做出既有帮助、又容易使用的产品。”(IT之家)
2
OpenAI 用 1 年时间证明,你并不用为 AI 换浏览器
全部
来源
内容由AI生成

精选参考来源

1. 【#OpenAI终极野心曝光#】据《商业内幕》今天(20 日)报道,OpenAI 员工乐观估计,公司正接近实现从创立之初就设定的目标:让 AI 智能体像人类一样熟练地操作电脑,尤其是使用浏览器。自 2015 年成立以来,OpenAI 一直希望实现这一能力,最大的难题之一是获得足够的训练数据。经过多年开发,公司现在已经有信心开始向客户逐步开放电脑操作功能。OpenAI 电脑操作团队经理阿里 · 韦恩斯坦指出:“一旦 ChatGPT 操作电脑和软件的速度超过你我,就会改变人们默认与电脑交互的方式。”OpenAI 最新模型从训练初期到后期的各个阶段,都加入了专门提升电脑操作能力的数据和训练流程。参与开发热门电脑操作智能体基准测试的哥伦比亚大学 AI 研究员周宇(音译)解释称,这些训练是在通用 AI 模型已有能力之上继续强化,让模型学会完成更多电脑任务。在最初的大规模基础训练阶段,OpenAI 很可能加入了逐帧屏幕截图,让模型提前接触有助于电脑操作的信息。进入后续训练阶段后,开发人员会向模型展示完成特定任务所需的正确操作。例如,要得到填写完毕的税务表格,或者完成一个物体的 3D 模型,就需要让模型学习对应的一系列电脑操作。其中一部分训练数据来自真人示范。OpenAI 公布 2025 年版电脑操作功能时曾透露,公司使用过由人类演示任务完成过程的数据集,但没有透露最新训练数据的具体情况。周宇指出,这类数据很昂贵,因为获取困难,整理成能够直接用于训练的形式也需要大量工作。OpenAI 很可能还利用强化学习继续提高模型的电脑操作能力,让模型反复尝试虚拟任务,并奖励成功完成任务的行为。周宇认为,模型可以学会更多执行这些“获得过奖励的操作”。OpenAI 也改变了模型实际操作电脑时获取信息的方式。韦恩斯坦表示,过去 ChatGPT 需要反复截取屏幕、分析像素、发送操作指令,再重新截屏分析。而目前在打开网站后,系统可以直接快速读取网页的底层信息,从内存结构、无障碍信息到链接关系都能应对。屏幕截图仍然是工作流程的一部分。用户开启电脑操作功能时,需要允许 ChatGPT 录屏,以便系统迅速识别当前显示的内容。韦恩斯坦表示,这些能力结合后,Codex 就能自行测试生成的代码、发现问题并继续修改,形成“完整闭环”。韦恩斯坦和负责 OpenAI 浏览器能力的詹姆斯 · 孙认为,电脑操作技术的一大价值,是让 ChatGPT 智能体能够进入互联网中大量彼此独立的服务和“长尾”网站。从预约网站、企业内部库存系统到社媒平台,许多在线工具起初就是为人类手动点击和输入而设计的。两人透露,已经有用户利用电脑操作功能自动处理数据录入、合规任务和日程安排。韦恩斯坦指出,OpenAI 模型能力提高后,也越来越能主动发现错误并自行修正,因此更容易把任务做完,也更不容易在网络环境中被无关内容带偏。周宇认为,目前电脑操作技术的速度距离普通消费者期待的水平仍有明显差距。“在训练数据非常充足的有限领域,电脑操作智能体确实可以表现得很好。想让它适应任何网页、任何应用程序和任何操作系统,仍然非常困难。”目前,电脑操作功能还不能迅速批量处理邮件回复,浏览社交媒体信息流时也显得较为迟缓。詹姆斯 · 孙和韦恩斯坦希望,随着 OpenAI 模型继续升级,电脑操作最终能够达到 AI 编程目前的效率,让 AI 直接操作网络工具比用户亲自动手更快。詹姆斯 · 孙表示:“对很多工程师来说,现在已经是让智能体写代码比自己写更快。根本不用权衡,直接让它做就行。我认为电脑操作以后也会越来越接近这种状态。”2025 年,OpenAI CEO 萨姆 · 奥尔特曼谈到早期电脑操作功能时曾公开示警:“实用价值很大,潜在风险也同样不小。我们建议只向智能体提供完成任务所必需的最低权限,以降低隐私和安全风险。”詹姆斯 · 孙表示,OpenAI 一直在研究“确认策略”,也就是 AI 执行下一步操作前,究竟应该在什么情况下向用户请求授权。目前的原则是,只要智能体准备向外传输数据或者删除内容,就必须先征得用户同意。网络工作往往需要连续快速地做出决定,因此 OpenAI 仍在寻找易用性和安全性之间的平衡。他坦言:“你可以把某个东西做到 100% 安全,但那样就非常非常难用了。也可以把它做得非常容易使用,但同时非常危险。所以我们真正想解决的问题,是如何做出既有帮助、又容易使用的产品。”(IT之家)

2. OpenAI 用 1 年时间证明,你并不用为 AI 换浏览器

3. RIP:只活了292天的Atlas

4. OpenAI关掉Atlas,AI浏览器输给了谁?

5. OpenAI 关停 Atlas 浏览器,AI 浏览器要凉了吗?

6. x402 让 AI 代理「找到你并当场付费」,这会改变互联网服务的商业模式吗?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章