今天凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。知乎发布会上,总裁布罗克曼留下一句注定要刷屏的话:"欢迎来到AGI时代。"奥特曼说得更直白:“我认为我们可能已经到达AGI了,我觉得就是这个模型。”
随后席卷朋友圈的,是一张对比图:ARC-AGI-3基准测试,GPT-6 Astra拿下99.9%,上一代GPT-5.6只有7.8%。知乎跨度大到让人下意识觉得——AGI真到了。
但发布不到24小时,有两类在刷屏截图里看不到的信息,比这句口号更值得停下来看。这篇帮你把四组关键数字对一遍:哪些是真实跃迁,哪些是应试高分,以及你现在到底要不要动你的ChatGPT订阅。
数字一:99.9%,是"穿了整套护具"的成绩
打造ARC-AGI-3基准的ARC Prize团队,在发布当天明确表态:不宣称这就是AGI。知乎
比立场更重要的是前提条件。99.9%这个接近满分的读数,是Astra搭配专门的Agent运行框架和记忆管理机制跑出来的;脱离这套增强环境,同一模型在同一基准上的得分会大幅回落。知乎也就是说,这是"模型+完整智能体脚手架"的联合成绩,不是模型裸奔的通用智能。用考试打比方:这更像允许带全套工具进场的开卷考,而不是摸底测验。分数是真的,但把它直接等同于"AGI已完成",结论跑得比证据快。

参考坐标:这套测试里,人类的平均得分是48%。网易号目前公认很强的Claude Opus 5,也只拿到30.2%。Astra的99.9%确实是巨大跃迁——但跃迁发生在带脚手架的考场上,不发生在通用智能的宣告里。
数字二:61.2对65.7,通用智能指数上它反而落后
换一个独立评测体系,画面更有意思。
在Artificial Analysis Intelligence Index v4.1.1里,GPT-6 Astra得分61.2,而Anthropic的Claude Fable 5.1是65.7。知乎"全球最强"这个说法,至少在通用智能这条轴上暂时不成立。一边是厂商高喊代际跃迁,一边是评测机构的分数纹丝不动甚至被友商压一头——这种分歧本身就说明:这次发布的真实水位,和发布会的情绪水位,是两回事。
数字三:57.9%和47%,真正的跃迁藏在"干活"里
那Astra到底强在哪?答案不在通用问答,在"把活干完"。
软件工程基准Terminal-Bench 4.0上,Astra拿到57.9%,上一代GPT-5.6 Sol只有37.3%。知乎OpenAI称之为自家史上最强的软件工程模型。电脑操作基准OSWorld 2.0上,Astra的完成率是72.6%,上一代为65.7%。网易号完成同类任务的耗时,从约75分钟降到40分钟,缩短约47%。FrontierMath Tier4数学测试则拿到97.6%。知乎

官方演示里的变化更直观:Astra能直接识别图形界面、自主操作软件,连续开发一周在虚幻引擎里搭出一个曼哈顿场景。知乎它还能根据一张表格图片还原出可编辑、可继续计算的Excel文件——交付物不再是"看起来像表格的图",而是真正能接着用的文件。
一句话概括这次的方向变化:AI正在从"告诉你怎么做"的文本顾问,变成"直接帮你做完"的执行者。这是值得认真对待的跃迁,但它和"AGI已至"是两回事——前者你这周就能用上,后者目前还是一句产品愿景。
数字四:2.5倍和105万,成本账和开发者的能力账
API价格这次明显上调,输入输出单价都约为GPT-5.6 Sol的2.5倍。知乎这是最容易被单独拎出来吓人的数字。

有意思的是,涨完价,在常用的272K上下文以内,Astra的定价反而和老对手Claude Fable 5.1拉平了:输入每百万token 10美元、输出50美元。知乎OpenAI这步棋,等于把旗舰模型的价格锚点直接对齐了最大竞品。
但"拉平"有前提:上下文一旦达到或超过272K,Astra的输入价格会涨到每百万20美元、是Fable 5.1的两倍,输出涨到75美元、是1.5倍。知乎
对Agent类任务,账还要换个算法:如果Astra完成同一任务用的token更少、重试更少、人工返工更少,任务总成本反而可能下降。已经有用户拿评测任务算过账:跑同一个评测任务,Astra的单任务成本只有1.67美元,不到Fable 5.1的一半。知乎选模型的实用标准不是每百万token的价格,而是"拿到一个合格结果,总共花多少钱、多久、人要返工几次"。
开发者侧还有两个容易被忽略的升级:上下文窗口扩到105万token,最高输出12.8万;Codex新增长任务上下文保存机制,能跨上下文窗口保留并重新检索之前的任务信息。对跑大型代码库和长周期Agent工作流的人来说,这可能比聊天能力的提升更值钱。
当然,已知短板也要说清:前端审美、三维构建、写作风格模仿还不够自然,需要视觉品位和稳定文风的任务,人还是得把关。
现在谁能用:Plus用户,别急着升级
这是当前最容易被误读的一件事,先把结论放这儿:
第一,GPT-6 Astra目前是灰度发布,先向少数组织开放,接下来几天逐步扩大到ChatGPT Plus、Pro、Business和Enterprise。知乎你现在打开模型列表看不到它,不代表账号有问题——灰度期"两个Plus账号,一个有一个没有"是正常现象。
第二,Plus在开放范围内,Astra不是Pro专属。Pro、Business、Enterprise还会额外获得一个Astra Pro,这才是套餐之间真正的差异点。知乎
第三,目前没有任何证据表明重新注册、频繁切换账号能提前拿到权限。官方口径是"over the coming days",没给精确时间。如果你已经在正常订阅,合理动作就一个字:等。等全量推送,再根据实际额度和Astra与Astra Pro的实测差距,决定要不要加钱。
接下来值得盯的三个信号
AGI的口号会很快降温,但这三个信号决定这次发布的真实含金量:
一是全量开放后的真实任务完成率。跑分有框架加持,普通用户在自己电脑上跑任务的返工率,才是试金石。
二是Astra和Astra Pro的实测差距。这决定套餐差价值不值,也决定这次"分级发布"到底是能力分层还是配额分层。
三是API开发者的总成本曲线。2.5倍单价能不能被更少的重试抵消,第一批开发者的账单大概一两周内就会出现。
还有一件事值得记在观察清单里:Astra的自动化网络攻防能力,在漏洞利用基准ExploitBench上拿到了满分。它也成为OpenAI历史上,第一个被判定达到网络安全Critical能力等级的模型。网易号

与此同时,OpenAI在系统卡里也承认,Astra的书面推理比前代更难被监控。网易号英国AI安全研究所的测试显示,它不依赖长思维链、一次性"心算"解题的时间跨度,从上一代的3.6分钟拉长到了30.9分钟。网易号模型行为更安全了,但人类读懂它的思考过程,反而变得更难了。能力解锁得越快,这条安全线越值得盯。
这次不必急着信"AGI已至",也不必急着否定。OpenAI的口号是产业愿景,ARC Prize的冷水是工程严谨,两者并不矛盾——我们走在通往AGI的路上,但还没到终点。对普通用户,记住一句话就够了:跑分是别人的考场,你自己的任务才是自己的账本。等灰度开到你的账号,拿它跑一件你真实的工作,答案自然就有了。