张大妈

具身智能的瓶颈:用人类视频数据破局

源自知乎:张海抱

01-15 18:57

具身智能的发展正面临数据瓶颈,而海量的人类视频数据正是未被发掘的宝藏。Physical Intelligence 提出了一套直接高效的方法,通过精准对齐人与机器人的动作数据,并利用多样化预训练,成功将人类知识迁移给机器人,显著提升了模型在未知场景、物体和任务上的泛化能力,为解决机器人数据稀缺问题提供了新思路。

具身智能的瓶颈:用人类视频数据破局智能速览

  • 具身智能发展的核心瓶颈在于数据稀缺。

  • Physical Intelligence 采用直接抽取人类动作数据进行训练的思路。

  • 通过数据采集方案,将人类手部姿态与机器人动作精准对齐。

  • 必须先进行多样化数据预训练,才能有效利用人类数据。

  • 实验证明,人类数据能有效提升机器人在新场景和任务上的泛化能力。

  • 人类数据是一种低成本的跨本体数据替代方案。

具身智能的瓶颈:用人类视频数据破局精华内容

那么,Physical Intelligence 是如何化繁为简,将人类视频数据有效转化为机器人训练燃料的呢?其成功关键在于数据对齐、预训练和实验设计三个环节。

数据对齐是基础

成功的第一步是解决人与机器人的数据鸿沟。研究采用类似 UMI 的采集方案,通过头显和腕部支架捕获人类动作,关键在于计算头戴相机与世界坐标系的位姿,以及手掌、中指等关键点的位姿,共 18 个维度。这些维度作为模型预测目标,确保了人类动作与机器人执行指令在空间上的一致性。对于难以对齐的夹爪开合度,则选择直接忽略,这种务实态度保证了核心数据的可用性。

预训练对齐表征

直接将人类数据与机器人数据混合训练效果不佳。研究发现,必须先通过大量多样化的任务和场景数据进行预训练。这个过程能将不同来源的数据(如不同机器人、不同人类)的表征映射到同一个隐空间,让模型学习到任务的本质和物理规律,而非表象。只有经过这一步,再加入人类数据进行微调,才能起到正面的促进作用,否则只会干扰模型学习。

泛化能力是关键

人类数据的真正价值在于弥补机器人数据的不足,尤其是在泛化能力上。实验设计巧妙地针对机器人数据未覆盖的场景、物体和任务进行测试。结果显示,引入人类数据后,机器人成功执行这些新任务的概率显著提升。研究还对比发现,人类数据的作用与使用另一种机器人本体(如 UR5)的跨本体数据类似,但其采集成本远低于后者,展现了极高的性价比。

跨本体的本质

深入来看,人类数据提供的是一种“跨本体”的视角,它帮助机器人理解如何用不同的“身体”去完成同一个目标。这种能力对于实现通用机器人至关重要。虽然 UR5 等其他机器人本体的数据在效果上可能略胜一筹,但考虑到成本和采集难度,人类视频数据无疑是一个更具规模和潜力的数据来源,为解决具身智能的数据瓶颈开辟了新路径。

Physical Intelligence 的方法证明了人类视频数据是解决具身智能数据瓶颈的有效途径。通过将人类知识低成本地迁移给机器人,我们离通用机器人的未来更近了一步。未来,如何更自动化、更大规模地利用海量互联网视频数据,将成为一个激动人心的方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐