具身智能领域面临数据获取成本高、质量要求严苛的难题。英伟达的三篇论文MimicGen、DexMimicGen和MimicPlay,通过创新算法展示了如何从少量人类演示数据中高效生成海量优质数据,为机器人高效学习提供了新思路。
智能速览
MimicGen可将200条人类数据扩增至5万条
通过任务分解与坐标变换生成新轨迹
DexMimicGen将该方法应用于复杂双臂协同任务
MimicPlay采用两阶段训练分离规划与执行
这些方法为解决具身智能数据稀缺问题提供了可行路径
精华内容
面对数据瓶颈,英伟达的研究提出了一种巧妙的思路:不再是盲目增加数据采集,而是学会‘举一反三’,让机器从有限的示范中自我创造学习素材。
数据扩增核心
MimicGen的核心是利用少量人类演示进行大规模数据扩增。研究中仅用200条人工数据,便生成了5万条高质量的机器人轨迹数据。其方法是将长时程任务分解为多个子任务,例如‘接近杯子’、‘拿起杯子’等。当物体位置发生变化时,系统会计算一个变换矩阵,据此调整机器人的初始位姿,确保与原始演示的动作逻辑一致。通过这种方式,机器人能够在新的场景中复现成功策略,极大地提升了数据利用效率。
迈向双臂协同
DexMimicGen将MimicGen的思想从单臂机器人拓展到了更复杂的双臂协同任务上。该研究于2024年3月发布,核心创新点在于处理双臂操作的独立性、顺序性与协同性。例如,在双手共同搬运积木或盒子的任务中,任何一只手臂的微小偏差都可能导致失败。该方法同样基于坐标变换生成轨迹,但需要精确匹配两只手之间的动作配合,为高级机器人操作提供了有效的数据生成方案。
规划与执行分离
MimicPlay则采用了另一种思路,强调从人类视频中进行高层级规划的学习。它采用两阶段训练法:第一阶段,模型从人类演示数据中学习一个潜在的规划器,掌握任务的宏观步骤;第二阶段,固定规划器,仅训练底层的动作执行网络。这种将规划与执行分离的模式,训练完成后,可以直接用新的人类视频作为提示,引导机器人完成目标,展现了更强的泛化能力。
这三篇论文从不同维度展示了提升机器人学习效率的路径,无论是数据扩增、多臂协同还是规划分离,其核心都是更聪明地利用数据。这些方法正成为具身智能研究的新趋势,未来机器人能否像人类一样通过少量观察就掌握新技能,值得持续关注。