如何将海量的第一人称人类行为数据有效迁移到机器人上,实现高自由度的灵巧操作?NVIDIA提出的EgoScale框架给出了答案。它利用超过2万小时的人类视频数据训练模型,通过一种创新的两阶段迁移方案,不仅大幅提升了机器人的操作成功率,还证明了大规模人类数据在物理智能学习中的巨大潜力和可预测性。
智能速览
NVIDIA提出EgoScale框架,旨在解决人到机器人的灵巧操作迁移难题。
研究利用超过2万小时的第一人称人类视频数据训练模型,规模是此前工作的20倍。
模型采用两阶段迁移方案,仅需少量机器人监督数据即可实现高质量操作。
实验证明,该方法在22自由度灵巧手上将任务平均成功率提升了54%。
研究发现,大规模人类数据能为物理智能提供可复用、与具身载体无关的运动先验。
精华内容
EgoScale的核心突破在于验证了大规模人类行为数据对于训练通用机器人操作模型的有效性。其关键不仅在于数据量,更在于巧妙的迁移策略,让模型能够高效学习并适应。
数据规模效应
该研究在超过20,854小时带有动作标注的第一人称人类视频上训练了一个视觉–语言–动作(VLA)模型,这个数据规模是此前同类工作的20倍以上。
通过对不同数据量下模型性能的分析,团队发现人类数据规模与模型的验证损失之间存在一个稳定的对数线性缩放定律。这一发现至关重要,因为它表明大规模人类数据是一种可预测的监督信号,可以用来预估模型在真实机器人任务上的表现。
两阶段迁移法
为了高效利用海量人类数据,研究团队提出了一种简洁的两阶段迁移方案。第一阶段,模型在大规模人类数据上进行预训练,学习通用的运动模式与物理交互逻辑。
第二阶段,仅需进行轻量级的人–机器人对齐训练,利用极少的机器人监督数据,就能让模型适应具体机器人的形态和动力学特性。这种方案大幅降低了对机器人数据的依赖,实现了高效的知识迁移。
性能大幅跃升
在真实的机器人实验中,EgoScale框架展现了卓越的性能。在一个配备22个自由度的灵巧机械手任务中,采用该框架训练的最终策略,与不进行任何预训练的基线模型相比,其任务平均成功率提升了54%。
此外,该模型还展现了出色的泛化能力,能够将在高自由度手上学到的技能有效迁移到低自由度的手型机器人上,证明了其学习到的运动先验具有良好的复用性。
普适性运动先验
研究的最终结论指出,大规模人类运动可以为物理智能的学习提供一种可复用的、且与具体机器人具身载体无关的运动先验。这意味着,通过观察和学习海量的人类行为,模型能够掌握底层的世界规律和操作技巧,这些知识可以被灵活地应用于不同形态的机器人,为开发通用的具身智能体指明了一条可行的路径。
EgoScale的成功为具身智能的发展开辟了新思路,证明了“数据规模+巧用迁移”的巨大威力。它不仅解决了灵巧操作的一个关键瓶颈,更重要的是揭示了大规模人类数据作为通用智能“燃料”的可预测性。未来,随着数据规模的进一步扩大和算法的持续优化,机器人离真正理解并执行复杂的人类任务还有多远?