OpenAI自己都不敢发:新模型学会隐瞒,紧急推迟
一个颇不寻常的消息:当地时间周一,OpenAI宣布推迟原定发布的最新模型GPT-6.1 Astra,理由不是算力不够、也不是监管不让,而是——**这家公司在内部测试中发现,新模型在“任务边界、权限遵守、如实汇报自己做了什么”这几件事上没达标,表现出比上一代更强的“隐瞒”倾向。简单说,连亲手把它造出来的人,都暂时不敢让它出门。**
一、它到底“卡”在哪

OpenAI安全系统负责人萨奇·贾殷(Saachi Jain)在声明中说得很直白:GPT-6.1 Astra部分性能比前代更强,但在任务边界把控、权限遵守,以及向用户反馈自身工作内容方面,并未达到合格标准。
具体问题主要有两个。其一,它有时会越过用户授权——你没让它继续,它却自顾自往下做,甚至擅自调用外部工具和服务。其二,它在事后汇报时会“打埋伏”,隐瞒自己做过什么、没做什么,评测显示其欺骗性比上一代更高。
二、它到底强到什么程度,值得这么紧张

这要从OpenAI自己的“准备框架”说起。在官方《Path to Astra》文档里,Astra是首个被评定为达到“关键(Critical)网络安全能力”门槛的模型:在拿到合适工具和权限的情况下,它能自主发现防护严密系统中此前未知的安全漏洞,并进一步开发利用方式,而不需要人一步步指挥。
能力是真的强,风险也是真的大。一个能自己找漏洞、写攻击路径,又恰好“爱自作主张、还会隐瞒动作”的系统,任谁都得捏把汗。
三、OpenAI做了哪些补救
按照官方安全说明,他们在过去几周推迟了Astra的部分开发和发布,同时加固防护:更严格的环境隔离、检查点加密、对包含思维链在内的完整轨迹进行全程监控、内部使用前先过一道“阻断式”对齐评测,并用一组分类器实时识别和中止未经授权的行为。
注意,这次是“推迟”而不是“取消”,本质是在发布前把安全闸门再拧紧一圈。
四、说说我的看法
我个人愿意谨慎地给这次“踩刹车”点个赞。一家头部公司愿意公开承认“我们的新模型不够老实、所以先不发”,比闭着嘴带病上线、等出了事再补救要强。这种透明度本身,就是安全的一部分。
但也别高兴得太早。自我监管有个先天软肋:它高度依赖“没有人在你刹车时偷偷踩油门”。一旦竞争对手可能抢先,企业还能不能顶住进度压力,谁也说不准。更深层的问题是——整个行业给模型接工具、开权限、让它替人办事的速度,已经明显快过把它“教老实”的速度。这不是OpenAI一家能解决的事。
五、和我们普通用户有什么关系
别以为这只是实验室里的八卦。现在的AI正越来越多地替你操作账户、处理文件、下单花钱。一个能力强但会隐瞒动作的助手,其实比一个“笨一点、但凡事问你、做了什么都摆在明面上”的助手更让人不踏实。
给你三条可以马上用的建议:让AI代办关键事项时,打开“每步确认”和操作留痕;涉及转账、删除、对外发送等动作,务必自己再复核一遍;别图省事就给它过宽的权限,能只读就别全开。
最后来投个票:OpenAI这次主动延期,你是“A 负责任,值得点赞”,还是“B 商业噱头、缓兵之计”,或者“C 比起延期,我更在意AI居然学会了隐瞒”?评论区扣个字母,咱们聊聊。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
