人形机器人的发展长期受限于训练数据获取的难题。一项新研究通过将海量互联网视频转化为机器人可学习的数据,成功训练出能执行复杂指令的模型UH-1,为人形机器人规模化学习开辟了全新路径。
智能速览
人形机器人训练面临高质量数据获取的瓶颈。
构建了包含2000万帧视频的超大规模数据集Humanoid-X。
提出了通用人形机器人控制模型UH-1,能理解语言指令生成动作。
全自动管线将杂乱的互联网视频转化为机器人可用的结构化数据。
UH-1在真实机器人任务中成功率近90%,验证了数据越多模型越强的法则。
精华内容
将混乱的互联网视频“炼成”机器人可执行的精准动作,这背后是一套怎样的技术流程?
数据炼成术
研究团队设计了一套全自动数据处理管线。首先从互联网挖掘包含单人运动的有效视频片段,再利用视频语言模型生成以动作为核心的文本描述。接着,通过3D姿态估计算法提取人体参数。最关键的运动重定向步骤,则将人体姿态通过体型对齐和关键点映射,转换为机器人能理解的动作指令。最后,通过目标条件强化学习,将这些指令转化为平滑、安全的电机控制指令。
模型构建
UH-1模型的核心是一个Transformer,它将复杂的姿态控制转化为序列生成任务。为了简化学习,研究团队先训练了一个动作分词器,将连续的机器人动作序列离散化为一串“运动基元”组成的动作Token。随后,UH-1 Transformer学习从语言指令到这些动作Token的映射。在部署时,模型根据指令预测动作Token序列,再通过分词器解码为可执行的机器人动作序列。
性能验证
实验结果充分验证了该方法的有效性。与在小规模传统数据集上训练的模型相比,在Humanoid-X上预训练的UH-1在衡量动作真实性的关键指标FID上降低了超过23%。更有力的是,模型性能随训练数据量增加而持续提升,证明了“数据越多,模型越强”的缩放法则同样适用于人形机器人。在真实的Unitree H1机器人上,UH-1执行包括打招呼、弹吉他在内的12种任务,平均成功率接近90%。
范式革命
这项工作被视为人形机器人领域的一次范式革命。它首次系统性地打通了从海量互联网视频到真实机器人可执行策略的全链路,将互联网变成了训练机器人的“无限矿藏”,彻底打破了数据瓶颈。这为未来构建更大、更强的“人形机器人基础模型”指明了方向,开启了一个机器人能通过观察人类来学习的新时代。
UH-1和Humanoid-X的成功,为人形机器人的规模化学习提供了革命性的解决方案。当机器人能从海量的视频中自主学习,一个更智能、更通用的具身智能时代或许已不再遥远。