6. 人形机器人最难的不是走路,而是端茶倒水?
这听起来像个笑话,但它就是2026年整个行业最扎心的现实。
今年5月,卡内基梅隆大学联合博世人工智能中心搞了个叫HTD的模型,核心思路是让机器人在脑子里提前“想象”下一秒手指会碰到什么、需要多大劲。
这套触觉预判机制加上强化学习训练的下半身控制器,让机器人在整理书籍、铲猫砂、端茶送水这五项真实任务上,成功率一口气提升了90.9%。
90.9%这个数字之所以让人兴奋,恰恰说明在此之前,机器人干这些事的成功率有多寒碜。
跑跳翻跟头为什么反而容易?因为那些动作在实验室里可以反复排练,地面是平的,灯光是稳的,路线是提前画好的,只要不当场摔倒,观众就鼓掌。端一杯水完全是另一回事。杯子在哪儿,水有多满,桌面滑不滑,用多大力气才不捏碎也不脱手,旁边有没有人突然经过,每一个变量都在实时变化。
真正的拦路虎出在手上,人类每只手有二十多个自由度,机器人灵巧手能稳定控制十几个到二十个自由度就已经算行业顶尖了。
特斯拉的Optimus光一只手就需要超过一百个独立部件,触摸传感器还存在耐用性问题,他们提出的解决方案居然是使用可更换的传感器“手套”。
宇树科技创始人王兴兴在9月的数贸会上说得很直白,当前最大的瓶颈是AI模型的输出与真实物理世界之间存在几毫米的误差,大动作方向没问题,但到了抓取、装配这些最后环节,几毫米的偏差没法自动修正,任务直接失败。
触觉是比视觉更难啃的骨头,摄像头能帮机器人认出杯子和瓶盖,但手指碰到物体那一刻,它不知道杯子是不是正在滑落、瓶盖有没有拧紧。
1971年有个叫伊恩·沃特曼的英国青年,因病毒感染失去了颈部以下的本体感觉,运动神经完好无损,却完全无法判断自己的手臂在什么位置。他只能死死盯着自己的手才能完成端水杯这种普通人毫不费力的动作,视线一移开,动作立刻失控。
今天的机器人面临的困境几乎一模一样,看得见却摸不着,有力量却不知道怎么使。
今年6月上海张江的具身智能供应链大会上,傲意科技发布了一款3D磁触觉灵巧手,传感器能感知0.1牛顿的力,大约相当于一只蝴蝶落在手背上的重量,剪切力方向分辨精度达到1度,采样频率150赫兹。
同月,纬钛机器人推出了专为灵巧手打造的视触觉仿生指尖GF515,硬件确实在快速追赶,但行业里有一句话说得透彻,叫“有手无脑、有指标无数据、能演示不能干活”。手有了,指挥手的脑子还没跟上,喂脑子的数据更是严重短缺。
数据有多缺?央视9月的一期节目里提到,从抓取物品到叠衣服,一个动作训练师要重复1250次。叠一件衣服,人类几秒钟的事,机器人要拆解成视觉识别、柔性操作、长程规划一连串步骤才能勉强完成。
王兴兴给出的路线图也很实在,他希望未来机器人能听懂一句话就生成动作,然后真正大规模干活,但眼下执行还有明显延迟,作业效率也有很大提升空间。
成本同样是一道坎,目前主流灵巧手单价普遍在两万到十万元以上,在人形机器人整机成本中占比高达20%到25%。特斯拉、宇树这些公司都在拼命压低价格,宇树9月发布的Dex5-S灵巧手把22个主动自由度压到了3.99万元起。可这个价格对普通家庭来说,依然只是一个开始。
今年6月,工信部和国务院国资委联合启动了人形机器人与具身智能实景实训专项行动,明确提出要在2026年底实现重点产品常态部署。方向很明确,机器人不能再待在实验室里表演了,得去工厂、仓库、餐厅、养老院这些真实场景里摔打。
实验室像考试前的样题,真实世界像老师临时加的附加题,箱子歪了,门没开,地上有水,工具被人随手放错地方,这些对人来说叫“今天现场有点乱”,对机器人来说分分钟让它怀疑机生。
从翻跟头到端稳一杯水,中间隔着的不是一小步,触觉传感器的精度、力控算法的响应速度、真实场景数据的积累量、整机成本的下降曲线,每一个环节都需要时间。
十年后机器人走进千家万户的预测能不能兑现,取决于行业能不能把那几毫米的误差磨平,把每一次翻车都变成一道真实错题,而不是一场精心编排的表演。