GPT-6 Astra喊出AGI时代,但它的网安能力连OpenAI自己都发怵!
➡️ GPT-6 Astra 以 99.9% 宣告 AGI 时代,从回答问题转向执行任务;网络安全能力让 OpenAI 自己都害怕,首个 Critical 级模型自主发现零日漏洞;三天内 Meta 和 Anthropic 相继发新模型,三家混战。AGI 真的来了吗?

文|捉驿 • 栏目|数字视线

一场考试,分数从 7.8 蹦到 99.9,好比一个常年挂科的学生突然拿了满分。
9 月 3 日,OpenAI 发布 GPT-6 Astra,总裁 Greg Brockman 在发布会最后甩出那句憋了很久的话:欢迎来到 AGI 时代。

但真正让人后背发凉的,压根不是 99.9 这个数字,而是这个模型能自己操作电脑、自己挖系统漏洞,甚至连 OpenAI 自己都得把它的最强能力锁进保险柜。
智能跃迁分数跳百倍,能力双刃安全锁千门。
看完这三章,你再跟朋友聊 AGI,就不只是说 "AI 变聪明了" 了。
◆ 从 7.8 到 99.9,一场被算法放大的跃迁
ARC-AGI-3 被叫做 "AGI 终极考卷",考的是 AI 扔进一个完全陌生的环境里,能不能自己摸清楚规则、完成目标。
GPT-5.6 Sol 在这张卷子上只拿了 7.8%,Astra 直接干到 99.9%。但这个数得拆开看:用 OpenAI 自己的测试配置跑是 99.9%,换成标准配置就只有 62.7%。
多出来的 37.2 分,本质上是允许它 "多想一步",而且这一步不用写出来给人看。
Astra 真正的分水岭不是跑分,而是从 "回答问题" 变成了 "持续把一件事干完"。
它像人一样直接盯着屏幕上的像素看,然后挪鼠标、敲键盘,自己操作浏览器、办公软件和开发工具。

OSWorld 2.0 测试拿了 72.6%,单项任务平均耗时从 75 分钟压到 40 分钟,快了将近一半。上下文窗口撑到 105 万 token,最大输出 12.8 万 token,DeepSWE v1.1 软件工程测试 74.1%,CAD 绘制测试 95.9%。
说直白点,以前的 AI 像个只会答题的学生,你问什么它答什么,但让它去办件事,它只会站在原地告诉你应该怎么办。
Astra 更像个刚入职的实习生,虽然偶尔会出错,但你给它一个目标,它会自己打开软件、一步步操作、遇到问题自己调整,直到把事情办完。

社区已经开始拿它练手了。
开发者 Pietro Schirano 让 Astra 根据设计要求生成一个完整可运行的 Mac 应用,15 分钟搞定。
另一位用户通过 MCP 接上 Ableton,让 Astra 从零做一首完整的曲子,从音色设计、乐器编排到混音流程全包了。
OpenAI 在发布会上也放了一堆 Computer Use 的实操演示,填表、数据分析、软件测试,这些过去要人一步步点鼠标的活,现在它自己能跑完全程。
◆ 满分的网络安全,和一把被锁住的刀
Astra 是 OpenAI《准备框架》下第一个摸到 "关键"(Critical)网络安全能力等级的模型。
这词什么意思?就是给它合适的工具和权限,它不需要人一步步教,就能自己找未知漏洞,对着加固过的系统搞出攻击手段。
ExploitBench 测试里,已知漏洞利用直接拿了 100% 满分,前代 Sol 才 78.5%。

怕它是背题背出来的,OpenAI 又专门拿 2026 年 6 月到 8 月才刚披露的 20 个高危 V8 漏洞重新测了一轮。
Astra 的任意代码执行成功率是 39%,Sol 只有 5.5%,差了 7 倍。
更离谱的是,跑着跑着它顺手挖出了两个之前根本没人知道的零日漏洞,还把它们串成了一条完整的漏洞利用链。
内部幻觉率从 Sol 的 9.4% 降到 Astra 的 2.0%,但沙箱逃逸测试依然被列在最高风险那一档。
OpenAI 的反应很干脆:先锁起来。
普通版本直接拒绝生成高阶漏洞利用代码,最先进的网络安全能力只放给 Daybreak Blue 计划审核过的合作伙伴,还有一个涉及最高级网络攻击能力的版本,只给网络防御机构用。
这大概是头一回,一个模型刚发布,厂商就因为它能力太强而严格限制谁能用。

行文至此,兴起,赋诗一首:
智破千关分数狂,网安双刃锁寒光。
模型越强人越惧,谁为苍生设堤防。
◆ 三天三家发模型,AGI 时代的真问题
Astra 不是一个人在唱戏。
9 月 1 日,Anthropic 发布 Claude Fable 5.1,8 项公开基准测试全部拿第一,缓存读取价格直接砍了 75%,典型负载下整体成本降了大约四分之一,还顺手推了个反蒸馏安全机制。
9 月 2 日,Meta 发布 Muse Spark 1.3,首席 AI 官 Alexandr Wang 话放得很直接:编码能力超过 GPT-5.6 Sol,跟 Claude Fable 5.1 持平。三天,三家,轮流喊 "全球最强"。
Meta 的杀入最有戏剧性。
今年 4 月 Muse Spark 刚出来的时候,第三方综合评分才 52 分,排在第四。
不到半年,1.3 版本直接挤进第一梯队。

但 Meta 还没拿定主意要不要开源 1.3 的权重,扎克伯格一边在社交媒体上喊开放 AI 有多重要,一边在巨额投资回报和开放理念之间反复横跳。
Anthropic 在目标估值 2 万亿美元的 IPO 前夕打出降价这张牌,英伟达则掏出 129.3 亿美元收购 Hugging Face,生态整合的步子越迈越大。第一梯队从 "两家掰手腕" 变成了 "三家混战"。
但 AGI 时代真正该问的问题,不是谁的跑分更高。
ARC Prize 官方说得很明白:"不宣称这是 AGI",因为测试范围有限、机制封闭。北大朱松纯教授此前指出,大模型本质上就是语言序列的概率分布统计工具,不具备真正的理解和因果认知。
OpenAI 首席科学家 Pachocki 也泼了盆冷水:智能的进步,并不保证对齐的进步。

我们一路追着 AI 往前跑,却很少停下来问自己到底要追到哪里去。
一边盼着它越来越聪明,一边又在它真变聪明之后心里发毛。
AGI 从来不是一个能打勾完成的终点,而是一场没尽头的追逐,每一次能力跃升都带着新的恐惧和新的问题。
智能的尽头,是新的开始
99.9 分不是答案,是一个新问题:当 AI 能自己干活、自己挖漏洞、自己迭代进化的时候,人该做的也许不是跑得更快,而是想清楚我们到底要往哪走。
AGI 不是一个可以勾选完成的任务,而是一场没有终点的追逐。
模型每一次能力跃升,都会重新定义智能的边界,也会重新划清安全的红线。
当 AI 能自己操作电脑、自己找漏洞、自己完成复杂任务时,真正的问题不再是它够不够聪明,而是我们有没有准备好和一个比自己更能干的伙伴共事。
未来几年,学会与 AI 协作的人会取代不会用 AI 的人,能定义 AI 方向的人会走在最前面。
你觉得 AGI 时代真的来了吗?如果 AI 能自己操作电脑干活,你最想让它帮你做什么?评论区聊聊。
#AGI时代# #GPT6# #OpenAI# #大模型# #人工智能# #网络安全# #Meta# #ClaudeCode# #AIAgent智能体狂飙#
【免责声明】 :本文部分配图源自公开渠道或CC0协议素材,仅作行业交流与产业参考使用。如涉侵权,请联系后台处理。本文仅做行业科普与实操分享,不构成任何投资、消费决策建议。文中数据及案例均来自公开信源,仅供参考,具体以实际为准。
