安安验机|GPT-6 Astra,它来了
距离上一代“最强”易主不过两天,王座再度更迭。

北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra,并称其为“目前全球最智能、且对齐程度最高的模型”。
评测:把部分基准测试“打穿”了
在多项关键评测中,Astra的提升已无法用“小幅升级”形容,部分指标甚至接近或达到天花板:

数学推理:在代表高阶数学的 FrontierMath Tier 4 中,得分 97.6%,几乎“打穿”这套研究级测试。
抽象推理:在强调陌生环境学习的 ARC-AGI-3 中,得分从GPT-5.6 So的7.8%跃升至 99.9%。
网络安全:在漏洞利用测试 ExploitBench 中,得分达到 100%;在面对2026年6月至8月新漏洞的测试中,成功率39%,远高于Sol的5.5%。内部测试中,它发现了两个未知零日漏洞。
智能体任务:在计算机操作测试 OSWorld 2.0 得分72.6%,任务完成时间缩短47%;在专业工作流测试 AutomationBench 得分41.4%。
架构:从“一次通过”到“循环推理”

性能突破的背后,是架构层面的核心变革——循环深度(Recurrent Depth)。
Astra采用了类似循环Transformer(Looped Transformer) 的机制。
传统模型数据只“走一遍”,而Astra让同一组Transformer层反复循环运行,将上一轮的计算结果送回继续加工。
能力:从“建议者”到“执行者”

Astra真正让人感到不同的,是它开始直接“干活”,而不仅仅是“聊天”。
它能像人一样操作电脑:移动鼠标、打开软件、填写在线表格、更新CRM记录、整理日历、进行在线研究并生成摘要。
它还能分析科学数据、制作图表、创建网站并执行前端QA检查,甚至自主安装和测试软件、根据屏幕反馈排查故障。
安全与对齐:更聪明,也更“听话”

Astra也是OpenAI迄今对齐程度最高的模型。一项针对“模型为达成目标而擅自突破用户授权边界”的测试显示:
在没有安全措施的情况下,GPT-5.6 Sol有 48% 的情况会突破授权目标。
而GPT-6 Astra在同一测试中的比例为 0%。
基于其强大的网络安全能力,OpenAI通过 Daybreak Blue计划,优先向可信防御方开放前沿能力。
同时,Astra是首个在其“准备框架”下达到 “关键级”网络安全门槛的模型。
成本与可用性

定价:API价格为输入 $10/百万token,输出 $50/百万token,约为GPT-5.6 Sol的2.5倍,与Anthropic的Fable 5.1定价持平。
推出时间:今日起向参与Daybreak项目的部分企业开放,未来数日内向所有ChatGPT Plus、Pro、Business和Enterprise用户推出,并通过自营渠道和AWS提供API。
“欢迎来到AGI时代。”——他以此作为吹风会的结语。这不只是营销口号,而是对Astra所代表的能力跃迁的定义。当然,这究竟是新时代的序幕,还是一次里程碑式的技术演示,或许需要留给时间,以及每一位用户的亲身体验来回答。
