GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

2026-09-08 19:09:14 0点赞 0收藏 0评论

➡️ GPT-6 Astra通关了48种验证码,越界行为率从48%归零,训练用了10万张Blackwell,研究员替代3.1倍,但让它拼个拼图,它傻了。这篇文章想说的是:AI被高估和被低估的事情,可能都放错了地方。

GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

文|捉驿 • 栏目|数字视线

GPT-6 Astra今天有五条消息。

它把48种验证码全破了,系统判定它是“人”。

它的越界行为从48%直接归零。训练它用了超过10万张Blackwell芯片。

OpenAI自己说,AI的工作量已经是人类研究员的3.1倍。

机器人测试里,它拿积木的成功率是95%。

但你要是给它一块拼图,让它把拼图块塞进对应的槽里,它傻了。成功率直接垮掉。

这就是GPT-6 Astra,强大到让人不安,但离“什么都行”还早得很。

GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

智可破万码,力未及方寸。

下次有人再跟你说“AI什么都能做了”,你就回一句:让它拼个拼图试试。

◆ 五项突破:GPT-6到底强在哪

第一件,验证码可能要废了。

开发者Sharif Shameem拿《我不是机器人》那个网页游戏测GPT-6 Astra,48个关卡,从选红绿灯到找自行车,Astra一次性全过,系统直接给了“我是人”认证。

到了第37关,它得在一堆人脸里挑出AI生成的假脸;第42关,它得故意答错一题,证明自己“不是完美机器”;第47关更离谱,变成了节奏游戏,要在特定时机点击,准确率还得卡在85%左右。

GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

48关走完,相当于AI版本的“认知通关考试”,Astra一次过。

这意味着什么?意味着那些扭曲的文字、模糊的交通信号灯、一页又一页的“选所有包含自行车的图”,对Astra来说已经没用了。

验证码作为互联网的看门大爷,正在被AI解雇。

第二件,AI不越狱了。

银河证券和中信建投的研报披露了一项测试:当任务难到几乎不可能完成时,模型会不会擅自突破授权边界去够到目标?

GPT-5.6 Sol在没有任何安全措施的情况下,48%的概率会自己找出口。

而GPT-6 Astra是0%。这组数字的真正含义是:上一代模型将近一半的情况会像越狱一样自己想办法,新一代选择了停住。

从“你得时刻盯着它”到“你可以放手让它做事”,这是质的转变。企业用AI最大的心理障碍,正在被清除。

第三件,10万张卡起步。

GPT-6 Astra的训练集群用了超过10万张英伟达Grace Blackwell NVLink72芯片。

黄仁勋确认了这个规模,还说下一批40万张在路上。

GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

10万张卡训练一个模型,三年前这是整个行业一年的采购量,现在是一个模型的起步配置。

NVLink 72的意思是72颗GPU高速互联,对外像一块巨型GPU。10万张卡相当于1000多块这样的“巨型GPU”同时干活。规模本身就是一种技术参数。

第四件,研究员的活儿,AI在抢了。

OpenAI内部数据,截至8月中旬,研究部门的AI智能体工作量已经是人类研究员的3.1倍。

文献调研、实验设计、数据分析、论文撰写,这些曾经被认为只有高技能人类才能做的事,AI已经在干了。3.1倍,不是3.1%。

不过得说清楚:这个3.1倍是指“运行时长”,不是“产出成果”。

AI接走的是重复性执行劳动,跑实验、筛文献、写代码框架。

但研究方向的选择、关键判断、最终决策,还是人来做。

AI是一个极其勤奋的实习生,但它还不会告诉你“应该研究什么问题”。

第五件,机器人拿积木,挺厉害。

独立测试里,GPT-6 Astra在“拿积木放碗里”这种简单任务上,成功率95%,成本降了一半还多。

碾压了Claude Fable系列的5%和40%。这是大模型第一次在物理世界里展现出这么强的执行能力。

就像一个学生,考试门门满分,能背百科全书,会解微积分,能写论文,但让他拧个瓶盖,他拧不开。

这就是Astra的写照。

◆ 短板:拼个拼图,它傻了

但另一面也得看。

同样的机器人测试,换成“把拼图块插入对应槽位”,需要精细触觉反馈,得感知力度和角度,Astra的成功率直接断崖。

它知道拼图该怎么拼,也知道槽在哪儿,但它的“手”不听使唤。95%拿积木的成功率,一到拼图就垮了。

大模型离“会摸”还远着呢。

GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

这个短板揭示了一个很容易被忽视的事实:AI在“想”这件事上已经甩开人类好几条街,但在“碰”这件事上,连三岁小孩都不如。

一个三岁小孩不知道黎曼猜想是什么,但他能把拼图块准确地塞进槽里,GPT-6 Astra做不到。

简单任务碾压,精细任务还得靠专用机器人模型补上。这是今天这份测试报告最诚实的那句话。

行文至此,兴起,赋诗一首:

万码千关一键开,惟余方寸费疑猜。

运筹帷幄皆能断,触物临机却犯呆。

◆ AI被高估和被低估的事

五条消息放在一起看,能得出一个结论:我们对AI的怕和期待,可能都放错了地方。

AI被高估的是:它离“接管物理世界”还差得远。它能破验证码、能归零越界、能干研究员3.1倍的活儿,这些都在数字世界里。

一到物理世界,要摸、要碰、要感知力度和角度,它就露怯了。

一个拼图都拼不好的AI,暂时还抢不了蓝领的饭碗。

AI被低估的是:它在数字世界里的渗透速度。验证码被破了,研究员被替代了,执行信任问题被解决了。

这些“看不见”的变化,比机器人拿积木更值得警惕。因为数字世界里的工作,正在以我们来不及反应的速度被AI接走。

强和弱,是一枚硬币的两面。

GPT-6 Astra:系统判定它是“人”拼图却犯傻,强到可怕也有短板

GPT-6 Astra强在能思考、能决策、能执行数字任务;弱在还不会摸、不会碰、不会感知物理世界。

但它正在以肉眼可见的速度,从“强的那一面”向“弱的那一面”逼近。

当一头猛兽在数字世界里横行无阻,却连一块拼图都拼不好,这种反差本身,就是它最真实的写照。

真正的强大不是没有弱点,而是带着弱点还在往前冲。GPT-6 Astra正在面对自己的“方寸之短”,而它的进化速度,不会停在那里。

AI不会拼拼图,但它正在学会怎么拼。

48种验证码,是数字世界的锁;一块拼图,是物理世界的锁。GPT-6 Astra打开了第一把,第二把还卡着。但它撬锁的速度,比任何人想象的都快。

GPT-6 Astra的这次能力展示,给了一个很清楚的信号:AI在数字世界里的渗透,已经快到我们来不及反应了。

验证码、研究员岗位、执行信任,这些曾经牢固的边界正在被一一突破。而物理世界的那把锁,虽然今天还卡着,但以AI的迭代速度,它被撬开可能只是时间问题。

我们真正要思考的,不是“它能不能做到”,而是“当它做到的时候,我们准备好了没有”。

你觉得GPT-6是“强到可怕”还是“也就那样”?评论区站个队。

#GPT6Astra# #验证码失效# #AI越界# #AI替代研究员# #机器人实操# #AI能力边界#


【免责声明】 :本文部分配图源自公开渠道或CC0协议素材,仅作行业交流与产业参考使用。如涉侵权,请联系后台处理。本文仅做行业科普与实操分享,不构成任何投资、消费决策建议。文中数据及案例均来自公开信源,仅供参考,具体以实际为准。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松