这周的世界机器人大会(WRC)把北京亦庄的展馆变成了"操纵"竞技场。近5万平方米的场馆里挤着300多家公司,机器人拣快递、叠衣服、做咖啡、铲猫砂,忙得像一群刚入职、急着证明自己的新人。人民网
视频刷屏的同时,评论区也吵成了两派:一派感叹"机器人都进化成这样了",另一派指着屏幕问"这后面是不是有人在遥控"。
两派都有证据。今天不站队,把多个信源看下来的东西摆一摆:今年WRC上的机器人操纵演示,哪些是真进步,哪些是摆拍,以及你想自己判断,该看什么。
摆拍的部分是真的,而且有点离谱
先说"摆拍",因为这是更多人心里的问题。
现场,两只机器狗偶遇后认真地互相"嗅闻",动作细腻得像真有嗅觉——直到有人顺着机器狗身后看过去:两个人类各自拿着一个操作手柄,正在努力替它们完成这场社交。
有的机器人连续五次抓不起桌上的一支中性笔,一次次伸手、一次次调整、再一次次抓空,急得旁边的观众想替它搭把手。还有机器人被测试博主一脚踹倒,躺在地上"抽搐"。
在现场逛了两天的每日人物还注意到一件更微妙的事:展会上确实有动作丝滑、效率极高的机器人,“但仔细看就会发现,它们很多时候离不开工程师在旁边操作和训练。一旦换个房间、换个物品、换个摆放位置,它还能不能完成同样的动作,还是未知数。”
这句话基本可以作为"遥控争议"的总结:演示的问题不在于有没有人参与——遥操作本身是行业正常的数据采集手段——而在于离开那个工程师、那束灯光、那张桌子之后,它还能不能复现。每日人物

但真进步也是真的,尤其是在分拣上
只谈摆拍,就低估了今年的变化。这届WRC最卷的岗位是拣快递,至少10家公司挤在传送带前竞争。
星动纪元的轮式机器人已经算"熟练工":差不多2秒把一个快递翻到单号朝上,纸箱、文件袋、软包通吃,每小时分拣1200件,客户催得紧时愿意提速到2000件。自变量的双臂最高每小时分拣1816件,有人故意把玩偶放上输送带,它能识别出来,再合力把"非快递"推下去。每日人物现场还有个细节:有星动纪元的工作人员在自变量展台旁低声讨论,对方包裹分拣进化速度很快,这让他们压力很大。
比速度更值得说的是一位现场工程师的回忆:去年机器人翻快递还经常"掉链子"——下午两点阳光最强的时候识别不出快递单;有的机器人不知道自己有没有完成任务,只会不断重复"抓起来、放下",抓空了也继续循环。今年,这两个问题都解决了。
而且演示之外,分拣已经是少数真正跑起来的场景。星动纪元这次除了展示双足机器人,还搬来一套物流分拣场景:上半身+五指灵巧手、腰部以下换成立柱结构的M7,直接面向固定工位作业,这套方案已经在顺丰、中国邮政全国十余个物流中心常态化运营,承担分拣、扫码等环节。光子星球
这类进步不是宣传口径,是现场能一条条对出来的。
判断一个演示是真还是摆,就问三个问题
社区里"遥操作还是自主"吵了很久,其实换个问法更容易分辨:
第一问:换个环境还能不能复现?
宇树创始人王兴兴在WRC上给通用机器人划过一条很具体的临界线:把机器人带进一个从没见过的新环境,只用语言告诉它要做什么,它能完成80%左右的任务——接近这个水平,才算接近产业真正的爆发点。他自己给出的时间是快则两三年,慢则五到十年。36氪他还在上市次日公开提醒:具身智能的"ChatGPT时刻"还没有到来。
所以下次看到一段演示视频,可以先问一句:这个成绩,是只在精心布置过的场地里成立吗?
第二问:成功率是多少,失败之后它怎么办?
银河通用创始人王鹤有个更直观的类比:今天的具身基础模型,大概相当于数字AI时代的GPT-2——能看到通用性的雏形,但离"零样本到各行业干活"还有一段距离,他预计到2028年前后才接近GPT-3.5到GPT-4的阶段。36氪
演示和干活的差距往往就藏在这里:演示只放成功的那一次,干活要面对失败的那一百次。王兴兴举过很具体的例子:让机器人移动、把一些东西装配在一起,或者把一个物体搬到另一个位置——从大趋势看,现在的模型没有太大问题,大差不差能执行任务,问题往往发生在最后几厘米,甚至最后几毫米。硅星人语言模型答错一个词还能继续生成,机器人手偏几厘米,杯子已经掉了。

第三问:它的数据是哪儿来的,有多少?
遥操作今年之所以被反复讨论,恰恰因为它从幕后走到了台前。睿尔曼在运营"机器人学校",150台机器人在里面接受遥操作训练,管理层的判断是"短期仍离不开人类"。B站上,遥操作方案已经是一个完整生态:VR头显、动捕服、数据手套、力反馈主从臂,各家厂商发教程教你怎么远程操控机械臂。小红书上,“遥操作数据采集"是正经岗位,从业者的日常吐槽是"数据采集也太累人了”。

这些都不丢人。行业眼下的共识就是:先靠人教机器人,再让机器人自己学。而且已经有人等不及要进真实环境了——自变量称,搭载其端到端模型的机器人自5月起通过与58同城合作,已进入深圳、北京、上海等地百户真实家庭,承担杂物归置、垃圾清运、叠被等任务。光子星球演示和真实家庭之间,开始有人真金白银地填坑。
本届WRC最重要的信号:厂商不吵路线了,都在抢数据
如果只看演示,你会错过这届大会真正的变化。硅星人(品玩)现场访谈了6家重要公司,结论很一致:去年展台上还在争论VLA、世界模型谁才是"机器人大脑"的最终路线,今年争论消失了——所有人都在说同一件事:数据。
擎朗智能的说法是"VLA是骨架,世界模型是让它先想后做的脑皮层";自变量说VLA回答"下一步做什么",世界模型回答"做完会怎样",两者会在统一模型里融合;星海图认为两者同源共生,本质都是把输入编码成Token再自监督预训练;而宇树的表述最直接:目前全球具身智能最大的瓶颈,是AI模型的输入和输出与真实世界之间仍存在偏差。硅星人
钱也在往这个方向涌。IT桔子数据显示,2026年上半年中国具身智能融资总额935亿元,累计已超1200亿元,超过去年全年67%。光子星球
出货量数据也印证了这个判断。第三方机构Counterpoint Research统计,2026年上半年全球人形机器人出货突破2.2万台,同比增长近300%,其中智元约9700台,宇树超7000台(约占全球三分之一),前五家厂商合计占86%。再看场景结构:文娱表演占33.6%,数据生产与科研占27%——也就是说,六成左右的出货机器人不是在"干活",而是在"表演"和"当数据采集演员"。真正进入智能制造的只有12.8%,仓储物流4.9%。36氪

顺带一提,不同口径的行业数字差异极大:央视报道今年上半年中国人形机器人出货超4万台、占全球97%,而Counterpoint的全球口径是2.2万台。央视新闻谁对谁错先不下结论,但这本身就说明这个行业的统计体系还很年轻,看到任何"遥遥领先"的数字,先问口径。
所以这届WRC的逻辑链其实很清楚:演示越来越丝滑,但泛化还不够;瓶颈在数据;于是所有人都在采数据。遥操作不是作弊码,它是通往自主的收费站。
"最后几毫米"为什么这么难,一个最新研究讲明白了
操纵难的本质在接触。最近社区里一篇论文解读值得拿出来说:BRIDGE框架把操作任务分成自由运动和"接触关键阶段"——销钉插入前的最后对齐、按压弹簧的瞬间、绕线碰到滑轮的那段弧。后者在整条路径里占比不到15%,却决定成败。
他们的实验结果:只用廉价的手持采集数据训练,绕线任务成功率只有44%;只补充相当于全程15%数据量的遥操作轨迹、而且集中用在接触阶段,成功率提到76%,接近全程遥操作训练的84%。知乎

这就是行业此刻的策略:用大量廉价数据负责"过程",用少量高质量遥操作数据负责"最后那一下接触"。看懂这一点,你也就看懂了为什么遥操作数采成了产业,也看懂了演示为什么丝滑、换个桌子就翻车。
接下来值得盯的三个信号
如果你持续对机器人操纵感兴趣,比起继续看演示,这三件事更值得跟踪:
一是数据规模的台阶。昆仑万维方汉的判断是:头部具身世界模型的数据大多还在十万小时量级,2026年底可能有人进入百万小时;如果具身模型也存在Scaling拐点,可能要到1000万甚至1亿小时。36氪而高质量真机数据每小时成本仍要数百元——谁先把采集成本打下来,谁就先走一步。
二是"测试时训练"。银河通用的WAM-TTT路线,想让机器人到了新客户现场,只需要拍员工怎么干活,不用人工逐条标注、也不用遥操作员重新采一遍完整轨迹,基础模型在测试阶段就能自己适应新环境。36氪这条路如果跑通,部署成本会降一个数量级。
三是灵巧手和触觉硬件。灵心巧手已经连续融资七轮、估值400亿元,产品价格从6666元到99999元——最贵的一只灵巧手,差不多是一台入门代步车的钱。每日人物这届WRC上,灵巧手明显开始卷触觉:要判断有没有握稳、笔尖受了多大压力,学"别把东西捏坏"。视触觉数据,很可能成为继视觉之后的下一块稀缺资源。

最后说一句:这届WRC离"真正上岗"还有很远,但方向比任何时候都清楚——不再争哪条路线是终局,而是先把物理世界一点点喂给模型。对看客来说,演示可以看个热闹,判断水平,记住那三个问题就够了。