过去三天,具身智能圈的情绪坐了一轮回形过山车。
9月3日OpenAI发布GPT-6 Astra,主打computer use;不到四天,X和B站上就冒出一批"直接上真机"的演示:一台普通机械臂、一个摄像头,模型不看代码、不写脚本,直接读画面输出末端位置和夹爪指令。知乎 B站UP主"从来你又调皮"那段标题写着"令我眩晕瘫坐,仿佛看到原子弹爆炸"的实机视频,两天冲到6.3万播放、373条评论;微博上开发者群的第一反应高度一致:“完了,具身智能这个赛道没得玩了。”微博
9月10日的外滩大会上,主持人把这句话原样扔给了自变量机器人创始人王潜:通用大模型已经能直接控机械臂,具身公司会不会被降维打击?微博
恐慌和兴奋其实都来自同一条信息——Robocurve实机基准里,Astra"抓方块入碗"的成功率是95%。微博 但这条刷屏信息的麻烦在于:它只讲了半张表。把这三天全网能找到的测试数据拼起来看,另外一半才是决定这个赛道走向的地方。
一、同一张跑分表,左列刷屏,右列没人提
把各家演示和评测里散落的数字归到一起,Astra在Robocurve上的真实成绩长这样:
任务 | GPT-6 Astra | Claude Fable 5.1 | 差距 |
|---|---|---|---|
方块入碗(20次) | 19次成功,95% | 8次成功,40% | 2.4倍 |
拼图入槽(蓝圆块入凹槽) | 10% | 与Astra同水平 | 基本持平 |
单次耗时 / 成本(方块任务) | 约为Fable的36% / 44% | 基准 | —— |
前两个数字都出自同一场实机测试,同一个模型,同一只机械臂。抓方块领先2.4倍,换一个任务直接跌回与对手同一起跑线——这不是跑分波动,是两个能力维度的分界线。知乎
为什么差这么多?方块入碗像把快递盒扔进纸箱:位置偏一点、姿态歪一点,容错照样兜住,主要吃"看没看对物体"。拼图入槽是钥匙插锁孔:要找准角度,要控接触力度,一个细小偏差就卡壳。前者考视觉理解,后者考物理交互——而Astra目前只在前者上碾压。
B站上一位把Astra接进robodojo做二次实测的UP主给出了几乎一样的结论:场景理解、任务理解、意图理解"已经完全可用",但"复杂接触、高速动态任务还有较大改进空间"。哔哩哔哩 刷屏视频里那些炫的,恰好全是左列任务。
还有一处细节值得留意:那个"原子弹爆炸"视频里,模型中途自己写了一套逆运动学(IK)来辅助决策——它能干活,一部分是靠现场给自己造工具,不是端到端都稳。哔哩哔哩 大模型接机器人当前的真实形态就是这样:任务分解和视觉理解已经能打,动作执行层还得靠边看边调。

二、反转:95%证明的恰恰不是"通用模型吃掉具身"
这是全网讨论里最被忽略、也最有价值的一层。
开发者圈子里这两天已经开始刷"Astra is the new VLA,VLA is dead"的梗。知乎 但Astra为什么能控机械臂?按王潜在外滩大会上的说法:不是语言模型"悟"出了动作能力,而是这个版本本身就吃了大量机器人数据——OpenAI和Anthropic从去年年初就开始采购机器人数据、自建小规模数据工厂、挖机器人方向的人才。微博 所以"能做出动作"不意外,意外的是它反向验证了一件事:
机器人数据预训练是有效的。

这话值得具身从业者多读一遍。过去两年,"要不要给模型喂真机数据"在行业里一直有路线之争:一派认为语言智能可以自然泛化出物理行动,一派坚持必须采集带物理交互的专有数据。Astra的95%等于用最强的通用模型给后一派盖了章——它能抓方块,恰恰是因为它吃了你一直说该吃的那种数据。这不是具身赛道的葬礼,是它的验算题被全世界最贵的实验室替你做了一遍。
王潜的推论更直接:如果OpenAI要继续往上啃精细操作,它就得建数据工厂、建仿真和实机评测、处理关节精度和相机位置这些硬件问题——做到那一步,它"其实也在逐渐变成一家具身智能公司"。微博 通用模型和具身模型不是对手,是双向奔赴。
注意信息边界:Astra的训练数据构成是王潜的访谈说法,OpenAI没有官方确认"机器人数据"的规模和来源;95%和10%的对比出自Robocurve测试,演示视频永远只放成功的那一次。结论说到这,不能再往上加码。
三、"理解"这条线,8B开源模型已经贴脸了
如果左列任务是通用大模型的独角戏,那故事还简单。问题是它不是。
9月9日,成立一年多的国内公司"深度机智"正式发布物理基座模型PhysBrain 1.5。微博 该模型以Qwen3-VL-8B为基座,把语言回答、空间输出、末端轨迹、未来RGB/深度预测全部离散成token,在单一自回归主干、单一next-token目标下联合训练,不设任务专属头。知乎

在其参与的28项具身空间智能与规划基准上,8B版本综合得分72.5,开源模型第一——对比GPT-6 Astra的73.3、Gemini 3.6 Flash的73.0,差距0.8分。知乎

要打个补丁:这是公司发布口径,基准选择和跑分由官方整理,第三方复现结果还没有。但方向信号是清楚的——在"看懂空间、想明白动作"这一层,8B模型和万亿级旗舰已经咬住了;真正拉开代差的,仍然是把动作执行到物理世界里的那30厘米。深度机智自己披露的内部实验也印证重心在哪:引入动作-状态联合建模后,动作预测从24%提到54%,而他们为此建的全景人类数据采集体系正在以"每月万小时级"的速度扩产。知乎
换句话说,这轮机械臂刷屏对行业真正扎心的地方不是"大厂来了",而是:大模型用真机数据证明了数据的价值,但数据不是它的独占品——谁都能采,采得狠的小团队已经能逼近它的分数。
四、三类人,三种算法
把上面的信息摊平,不同位置的人该得出的结论完全不同:
做VLA、考虑跳槽方向的研究工程师。你的风险不在"模型不够大",在"数据闭环不够深"。Astra验证的恰恰是数据路线,纯调参、不碰实机、没有采集-验证闭环的团队才是被碾压的那批。继续观察的信号:OpenAI是否推出面向机器人的正式API/产品线——目前它只有社区自发接入,官方还没下场。
机器人集成和应用开发者。今天的最优架构大概率是混合:拿Astra这类通用模型做任务分解、意图理解和跨设备调度(这部分它确实碾压),动作执行层继续用轻量的专用模型——实机部署要的推理速度、显存占用和硬件适配,通用大模型暂时都给不了。别急着"全站换Astra",也别急着说它是玩具,两条腿走路。
在追投具身赛道的投资人/观察者。为"95%成功率"重定价之前,先问一句:这个数是"方块入碗"的,不是"叠衣服"的,也不是"厨房流水线"的。真实商业场景几乎都是拼图入槽那一列。看项目别看demo的左列,看它有没有自己收得动、验得准的物理数据管线。
至于群里那句"这个赛道没得玩了"——它和"AGI来了"是同一枚硬币的两面,都是只看了半张表。Astra对拿demo融资讲故事的人是坏消息,对真做数据、真上机的人是免费的市场教育。原子弹没爆炸,是跑分表被从中间对折了。
数据口径说明:Robocurve两项任务成绩来自实机基准测试;方块任务2.4倍、耗时36%、成本44%的比例转述自B站实机测试视频描述;PhysBrain 1.5发布时间与72.5均分参照深度机智官方发布口径,第三方复现待观察;Astra训练含机器人数据的说法出自王潜外滩大会访谈,OpenAI未官方证实。本文信源:知乎(《GPT-6Astra会给具身行业带来哪些影响?》相关问题与回答、甲子光年及AI科技评论专栏)、微博(外滩大会现场讨论、中关村科学城官方发布)、B站实机测试视频(BV18kYW6qELx、BV1tybM6jEBy等)、36氪。