奥特曼重新造机器人:GPT-6实测95分却卡在最后10毫米,两万元的家用机器人要不要等

源自91位全网作者

05:08

9月20日,上海一场发布会挤满了人,稚晖君的启元机器人把两款消费级个人机器人直接开售:88厘米高的Q1人形机器人,22个柔顺力控关节,标准版19999元、探索版26999元,机身可折叠塞进背包,软硬件开源,主打家庭DIY和二次开发。 同一天,大洋另一边,OpenAI的招聘页上挂着27个机器人相关岗位,其中一个供应链岗位的说明里写着一句不像AI公司会写的话:We’re a growing hardware company——我们正在成为一家不断成长的硬件公司。 这两件事发生在同一天,其实是在回答同一个问题:机器人的"身体"已经便宜到两万元能拎回家,那"大脑"呢?而重新坐回机器人牌桌的奥特曼,到底在造什么。微博知乎

27个岗位暴露的,不是"做机器人",是"做机器人公司"

如果OpenAI只是想给机器人配一个更聪明的大模型,它不需要招齿轮设计工程师,不需要电机电磁设计、执行器测功台、PCB、制造工程、EHS、供应链品类经理,更不需要一名只为机器人业务服务的商业律师。但知乎作者"42号电波"逐条翻完OpenAI的公开招聘后发现,这些岗位现在全挂着。知乎

最有信息量的是执行器岗位:不是采购成熟关节,而是明确要求设计custom robotic actuators(定制机器人执行器),覆盖电机、传动、传感、热设计和结构,并在扭矩密度、带宽、效率、可靠性和成本之间做系统权衡,配套岗位还要自建测功机和执行器测试台,测扭矩、速度、温度和耐久。知乎

这条"身体也要自己造"的路线,其实是被合作方教育出来的。2023年,OpenAI Startup Fund领投人形机器人公司1X的2350万美元融资;2024年又投资Figure,签协议共同开发下一代人形机器人AI模型——分工很清晰,Figure懂硬件,OpenAI出大脑。知乎

但这段合作只维持了一年左右:2025年2月,Figure CEO Brett Adcock宣布结束合作,把机器人AI全部收回自研,理由直戳行业核心争议——要在真实世界大规模解决具身智能,大脑和身体必须垂直整合,不能分开外包,随后Figure发布了自己的Helix VLA。 一年多以后,OpenAI的招聘页面看起来得出了同一个结论。知乎

第一次失败输在数据,这次先建"机器人数据工厂"

奥特曼的机器人故事有个容易被忽略的前史。七年前OpenAI也有一支明星机器人团队:Dactyl用Shadow灵手在模拟环境里训练,再靠域随机化把策略迁移到真实世界,2019年那只机械手已经能单手转解魔方。但机器人没有成为下一个GPT——2021年,联合创始人Wojciech Zaremba确认团队解散,理由是机器人领域缺少足够的数据,没法像语言模型那样持续扩大训练规模。知乎

有意思的闭环在这里:第一次做机器人,OpenAI想尽量用仿真绕过昂贵的真实数据;第二次回来,它首先建的是规模化生产真实数据的基础设施。这次招聘里有一整套组织围绕Robotics Data Acquisition(机器人数据采集)建立:数据采集技术项目经理要把机器人、传感器、操作员界面和数据管线组成"production-ready"的数据采集系统并扩展到多站点;运营经理要盯利用率、Cycle Time、Throughput、Downtime和数据质量——几乎是一套制造工厂的生产指标;还有一个Field Engineer岗位,负责维护一个"大型、持续运行的真实机器人环境",要求"几乎不能容忍停机"。这意味着OpenAI正在搭建的可能不是一个普通机器人实验室,而是一座机器人数据工厂。知乎

GPT-6 Astra实测:大脑已经很强,卡在最后10毫米

身体之外,大脑这一侧这两周也在刷屏。一台约150美元的SO-101机械臂,在GPT-6 Astra控制下画出了金门大桥——不是照预设轨迹,是先规划落笔、再靠摄像头边画边看,视频爆火后奥特曼本人直接转发:给我也来一个!机器之心

CMU Robotics的Wenli Xiao做了个更硬核的实验:先录一段人类完成新任务的视频,把录像丢进Codex,再让GPT-6 Astra控制机械臂照做——一次跑通,作者把这称为"physical ICL":大模型从上下文示例里临时学会新任务的能力,在物理世界也成立了。机器之心

但真正值得看的,是RoboCurve那组不整活的实测:让Astra看着三个相机视角和机械臂自身状态,直接规划双臂动作,把桌上的红色积木抓起来放进碗里,20次成功19次,同样的测试里另一家旗舰模型Fable 5.1只成功了8次。机器之心

测试任务

GPT-6 Astra成绩

说明

双臂抓积木放入碗中

20次成功19次(95%)

另一旗舰模型Fable 5.1仅成功8次

圆形拼图精确嵌入凹槽

20次成功2次(10%)

能找到、抓住、移到附近,最后几毫米插不进去

50Hz实时控制四足行走

250次推理≈走出5秒

推理速度跟不上毫秒级底层控制

95分和10分之间的落差,就是现在"机器人大脑"的真实水位:把任务换成把一块圆形拼图精确嵌进对应凹槽,成功率立刻跌到10%,20次只完成2次。 理解环境、判断目标、规划动作这些"头脑"擅长的部分已经很强,一个并没有专门为机器人训练的通用模型已经能把粗操作做到95%;可一旦进入高频反馈、精细接触和力控制,最后10毫米就成了天堑——位置角度稍有偏差零件就对不上,而这是插网线、插电源、拧螺丝这类真正有用的工作的全部门槛。机器之心

Physical Intelligence最近专攻的"最后一毫米",就是卡在这里:让一个通用机器人模型拿起螺丝刀很简单,想要快速、准确地对准一颗很小的M3螺丝,仍然需要通过在线强化学习继续优化,网线插入、电源线插入、扎带固定等任务也都卡在类似的精细接触阶段。机器之心

3亿美元买"眼睛":模型、眼睛、身体、数据,奥特曼在拼一整套

招聘之外还有收购。据华尔街日报消息,OpenAI已经以超过3亿美元收购相机技术公司Glass Imaging,交易尚未得到官方确认。 这家公司的创始人Ziv Attar和Tom Bishop都出自苹果计算摄影团队,参与过iPhone人像模式的开发,但技术方向不是AI修图:用针对具体镜头和传感器训练的神经网络,直接接管从RAW原始信号到成品图像的整条ISP流水线,目标是恢复传感器真实捕捉到的信息,而不是把模糊的文字和月亮"猜"得更清晰。APPSO

这个区别对消费者无感,对Agent致命:照片拍得好看即可,但如果图像要交给Agent去识别商品、操作设备、规划行动,凭空补出来的物体和文字就是错误操作的来源。照片是人观看的终点,却可能只是Agent工作的起点;摄像头的身份也在变化,过去替人保存值得回看的画面,未来将变为向机器提供判断下一步行动的依据。APPSO

别忘了去年OpenAI还花65亿美元买下了Jony Ive的硬件公司io。 模型(GPT-6)、眼睛(Glass)、身体(执行器和数据工厂),奥特曼在拼一整套东西。APPSO

回到那个两万元的问题:买,还是等

现在把视线拉回上海发布会现场。小红书上的真实声音是分裂的:有人当晚就去现场提货开箱,把Q仔带回了家;评论区里更多人问的是"充一次电能用几小时"“花几万买个玩具”,还有人直接说看过今年的WAIC就知道国内具身智能实际产品有多拉胯。小红书小红书

结合OpenAI这波动作,我的判断是三条。第一,想买来开发、折腾、二次开发的,Q1这类开源机身现在买是合理的:19999元买到22个力控关节的可折叠身体和整套开源软件栈,这个价格锚点本身就是这一轮供应链成熟的结果;同场发布的T1还支持轮足人形/四足形态自动切换、自主回充和跟随拍摄,售价同样19999元起,不过要等到10月1日才按订单发货。微博

第二,想买来"干活"的,再等等。现在两万元买到的是演示级能力:跟随、拍照、简单交互,行业论坛里的共识也在转变——评判标准正从参数和演示视频,转向客户复购率和真实订单报表。 真正有用的操作类任务,卡在GPT-6 Astra都还没跨过去的最后10毫米和毫秒级控制——这不是刷两个版本模型就能解决的,是数据、硬件、控制栈的系统工程,也正是OpenAI现在才开始建数据工厂的原因。微博

第三,接下来值得盯三个信号:OpenAI的机器人硬件是否正式发布,看招聘页那句话离产品落地还有多远;GPT-6 Astra是否向第三方机器人开放API,一旦开放,你现在买的开源身体就有机会"换脑"升级;以及Physical Intelligence和Figure在"最后一毫米"上的进展,在线强化学习能否把10%拉到90%。

2015年6月,奥特曼在一场科技大会上说"AI很可能,大概率,会导致世界末日",然后补了后半句:不过在那之前,会有一批了不起的公司。 现在看,他显然打算让"了不起的公司"里有一家,连齿轮都自己造。微博

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐