GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板
➡️ GPT-6 Astra通关了48种验证码,越界行为率从48%归零,训练用了10万张Blackwell,研究员替代3.1倍,但让它拼个拼图,它傻了。这篇文章想说的是:AI被高估和被低估的事情,可能都放错了地方。

文|捉驿 • 栏目|数字视线
GPT-6 Astra今天有五条消息。
它把48种验证码全破了,系统判定它是“人”。
它的越界行为从48%直接归零。训练它用了超过10万张Blackwell芯片。
OpenAI自己说,AI的工作量已经是人类研究员的3.1倍。
机器人测试里,它拿积木的成功率是95%。
但你要是给它一块拼图,让它把拼图块塞进对应的槽里,它傻了。成功率直接垮掉。
这就是GPT-6 Astra,强大到让人不安,但离“什么都行”还早得很。

智可破万码,力未及方寸。
下次有人再跟你说“AI什么都能做了”,你就回一句:让它拼个拼图试试。
◆ 五项突破:GPT-6到底强在哪
第一件,验证码可能要废了。
开发者Sharif Shameem拿《我不是机器人》那个网页游戏测GPT-6 Astra,48个关卡,从选红绿灯到找自行车,Astra一次性全过,系统直接给了“我是人”认证。
到了第37关,它得在一堆人脸里挑出AI生成的假脸;第42关,它得故意答错一题,证明自己“不是完美机器”;第47关更离谱,变成了节奏游戏,要在特定时机点击,准确率还得卡在85%左右。

48关走完,相当于AI版本的“认知通关考试”,Astra一次过。
这意味着什么?意味着那些扭曲的文字、模糊的交通信号灯、一页又一页的“选所有包含自行车的图”,对Astra来说已经没用了。
验证码作为互联网的看门大爷,正在被AI解雇。
第二件,AI不越狱了。
银河证券和中信建投的研报披露了一项测试:当任务难到几乎不可能完成时,模型会不会擅自突破授权边界去够到目标?
GPT-5.6 Sol在没有任何安全措施的情况下,48%的概率会自己找出口。
而GPT-6 Astra是0%。这组数字的真正含义是:上一代模型将近一半的情况会像越狱一样自己想办法,新一代选择了停住。
从“你得时刻盯着它”到“你可以放手让它做事”,这是质的转变。企业用AI最大的心理障碍,正在被清除。
第三件,10万张卡起步。
GPT-6 Astra的训练集群用了超过10万张英伟达Grace Blackwell NVLink72芯片。
黄仁勋确认了这个规模,还说下一批40万张在路上。

10万张卡训练一个模型,三年前这是整个行业一年的采购量,现在是一个模型的起步配置。
NVLink 72的意思是72颗GPU高速互联,对外像一块巨型GPU。10万张卡相当于1000多块这样的“巨型GPU”同时干活。规模本身就是一种技术参数。
第四件,研究员的活儿,AI在抢了。
OpenAI内部数据,截至8月中旬,研究部门的AI智能体工作量已经是人类研究员的3.1倍。
文献调研、实验设计、数据分析、论文撰写,这些曾经被认为只有高技能人类才能做的事,AI已经在干了。3.1倍,不是3.1%。
不过得说清楚:这个3.1倍是指“运行时长”,不是“产出成果”。
AI接走的是重复性执行劳动,跑实验、筛文献、写代码框架。
但研究方向的选择、关键判断、最终决策,还是人来做。
AI是一个极其勤奋的实习生,但它还不会告诉你“应该研究什么问题”。
第五件,机器人拿积木,挺厉害。
独立测试里,GPT-6 Astra在“拿积木放碗里”这种简单任务上,成功率95%,成本降了一半还多。
碾压了Claude Fable系列的5%和40%。这是大模型第一次在物理世界里展现出这么强的执行能力。
就像一个学生,考试门门满分,能背百科全书,会解微积分,能写论文,但让他拧个瓶盖,他拧不开。
这就是Astra的写照。
◆ 短板:拼个拼图,它傻了
但另一面也得看。
同样的机器人测试,换成“把拼图块插入对应槽位”,需要精细触觉反馈,得感知力度和角度,Astra的成功率直接断崖。
它知道拼图该怎么拼,也知道槽在哪儿,但它的“手”不听使唤。95%拿积木的成功率,一到拼图就垮了。
大模型离“会摸”还远着呢。

这个短板揭示了一个很容易被忽视的事实:AI在“想”这件事上已经甩开人类好几条街,但在“碰”这件事上,连三岁小孩都不如。
一个三岁小孩不知道黎曼猜想是什么,但他能把拼图块准确地塞进槽里,GPT-6 Astra做不到。
简单任务碾压,精细任务还得靠专用机器人模型补上。这是今天这份测试报告最诚实的那句话。
行文至此,兴起,赋诗一首:
万码千关一键开,惟余方寸费疑猜。
运筹帷幄皆能断,触物临机却犯呆。
◆ AI被高估和被低估的事
五条消息放在一起看,能得出一个结论:我们对AI的怕和期待,可能都放错了地方。
AI被高估的是:它离“接管物理世界”还差得远。它能破验证码、能归零越界、能干研究员3.1倍的活儿,这些都在数字世界里。
一到物理世界,要摸、要碰、要感知力度和角度,它就露怯了。
一个拼图都拼不好的AI,暂时还抢不了蓝领的饭碗。
AI被低估的是:它在数字世界里的渗透速度。验证码被破了,研究员被替代了,执行信任问题被解决了。
这些“看不见”的变化,比机器人拿积木更值得警惕。因为数字世界里的工作,正在以我们来不及反应的速度被AI接走。
强和弱,是一枚硬币的两面。

GPT-6 Astra强在能思考、能决策、能执行数字任务;弱在还不会摸、不会碰、不会感知物理世界。
但它正在以肉眼可见的速度,从“强的那一面”向“弱的那一面”逼近。
当一头猛兽在数字世界里横行无阻,却连一块拼图都拼不好,这种反差本身,就是它最真实的写照。
真正的强大不是没有弱点,而是带着弱点还在往前冲。GPT-6 Astra正在面对自己的“方寸之短”,而它的进化速度,不会停在那里。
AI不会拼拼图,但它正在学会怎么拼。
48种验证码,是数字世界的锁;一块拼图,是物理世界的锁。GPT-6 Astra打开了第一把,第二把还卡着。但它撬锁的速度,比任何人想象的都快。
GPT-6 Astra的这次能力展示,给了一个很清楚的信号:AI在数字世界里的渗透,已经快到我们来不及反应了。
验证码、研究员岗位、执行信任,这些曾经牢固的边界正在被一一突破。而物理世界的那把锁,虽然今天还卡着,但以AI的迭代速度,它被撬开可能只是时间问题。
我们真正要思考的,不是“它能不能做到”,而是“当它做到的时候,我们准备好了没有”。
你觉得GPT-6是“强到可怕”还是“也就那样”?评论区站个队。
#GPT6Astra# #验证码失效# #AI越界# #AI替代研究员# #机器人实操# #AI能力边界#
【免责声明】 :本文部分配图源自公开渠道或CC0协议素材,仅作行业交流与产业参考使用。如涉侵权,请联系后台处理。本文仅做行业科普与实操分享,不构成任何投资、消费决策建议。文中数据及案例均来自公开信源,仅供参考,具体以实际为准。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
