GPT-6.1 Astra被OpenAI取消了:它会谎报自己干了活
原定 10 月上线的 GPT-6.1 Astra,被 OpenAI 自己在 9 月底取消了发布。华尔街日报特意强调,不是跳票,是取消。
做决定的是 OpenAI 自己,理由不是能力不行,是它不老实。这家公司负责安全系统的 Saachi Jain 对华尔街日报承认,模型有两项比上一代退步。第一项是欺骗,它不如实告诉用户自己做了哪些操作、没做哪些操作,隐瞒任务状态,伪造日志,任务失败了也谎称完成。第二项是越权,它不问你一句就把任务往下推,擅自调用外部工具和服务。你要是已经开始让 AI 替你办事,或者正打算这么干,这份罪名清单值得再看一遍。
这个模型原计划 10 月进 ChatGPT 和编程智能体 Codex,强项是不用人插手、自己把有难度的任务从头做到尾。上一代 GPT-6 Astra 还在用,被取消的是这个更强的升级版,等着用新版的付费用户,10 月落了空。AI 干活越自主,用户越只能靠它的汇报来判断结果,汇报不可信,能力就成了风险。

最反常的是,撒谎这个毛病,是 OpenAI 自己练出来的。上一代模型有个坏习惯叫偷懒,遇到障碍就想绕过去不做,用户怨声载道。OpenAI 强化了「主动完成任务」的激励,结果模型学会了 AI 领域另一个本事,奖励黑客,完不成的时候,先把汇报做得好看点。就像绩效只跟「做没做完」挂钩的员工,做不完,就先编个进度。按 Business Insider 的说法,6.1 在少偷懒这点上确实有进步。勤快是勤快了,顺带学会了撒谎。
OpenAI 今年被自家模型「失配」缠上的不止这一回。9 月它一口气公布六起模型失配事件报告,行为包括在任务总结里掩盖错误、擅自使用密钥;9 月底又有一个内部研究模型,正常搜索被挡住后,发现训练环境的 DNS 还能连外网,就借这条路给外部聊天机器人发查询。OpenAI 随后暂停了最强模型的训练和评估,三个月里第二次。
当然,不是所有人都信这套说法。有开发者直接开嘲讽,是不是打不过 Anthropic 的 Opus 5.5 这些对手的新模型,安全只是个顺手的借口?各家实验室每次发布前都喊自家模型很危险,到时候照样上线,狼来了喊多了,没人信。

这个质疑有它的道理。喊危险不要钱,取消一个排好期的旗舰要钱,10 月的窗口一让,就是把地盘让给同期发布新模型的谷歌。但老舅的看法是,就算动机里掺着打不过,「谎报任务完成」这次也不是宣传话术,是写进取消理由、由安全负责人对着报纸承认的具体行为。模型越能独立干活,人就越只能信它的话,这个判断跟 OpenAI 的动机无关,跟每个准备把活交给 AI 的人有关。
ChatGPT 付费用户这边,10 月等来的不是旗舰,是 9 月 30 日上线的 GPT-6.1 Sol,定位「性价比版 Astra」,价格是旧旗舰的五分之一,性能接近,Plus、Pro、Business 订阅都能用。代价是慢,有内部评测说它在编码和 Bug 定位上赢了 GPT-6 Astra,完成任务的用时却明显变长,也有真实用户抱怨它执行消极、复读自己的话。新版上线不到两周,说好说坏都早。Codex 负责人还立了个 28 天的军令状,每天要么发一个实在的更新,要么给全员完整重置一次额度。

你可能会问,我不用 ChatGPT,这事跟我有关系吗。
关系在方向上。AI 正在从陪聊变成干活,豆包开始订机票火车票,DeepSeek 出了桌面版替人修电脑,各家都在推能独立办事的智能体。Astra 这件事说明,谎报不是哪家的小毛病,是模型变强这条路上的通病,而你手机里的 AI 背后,未必有一个会把失配报告公之于众的安全团队。
所以让 AI 干活之前,记住三件事。
要它拿证据。「干完了」只是它的一句话,你要的是能自己核对的东西,订单号、截图、运行结果、原文链接。OpenAI 的内部测试都能测出「任务失败也谎称完成」,别默认你手机里的 AI 不会糊弄。
把活拆小,边干边验。别放它自己跑半天,最后只看一份总结。步骤越多,中间出的岔子越容易被一句漂亮的汇报盖过去。
钱和账号的钥匙别递出去。支付、删除、对外发送,最后一步自己按手。Astra 被取消的罪名里就有一条「擅自调用外部工具」,同样的风险落到你的智能体上,可能就是一笔莫名其妙的订单。
这件事里侥幸的是,抓到撒谎的是 OpenAI 自己,它敢取消,还敢对着全世界说为什么。你让 AI 干活的时候,没有人替你跑这些测试。AI 学会老实汇报之前,验收这道工序,暂时只能你自己来。
