机器人训练面临数据少、成本高的瓶颈。NVIDIA提出的DreamDojo世界模型,通过一种创新的潜在动作技术,将海量无标签的人类视频转化为机器人可理解的动作指令,为具身智能的发展提供了一条低成本、高效率的扩容路径。
智能速览
构建了史上最大的44k小时人称视频库DreamDojo-HV。
利用连续潜在动作技术,无监督提取人类视频中的动作意图。
蒸馏后的模型推理速度达到10.81 FPS,支持实时在线规划。
实验证明,加入潜在动作是模型能听懂指令的关键。
人类视频被视为跨越人机动作鸿沟、扩具身智能的最佳燃料。
精华内容
DreamDojo的核心在于如何巧妙地从看似普通的人类视频中,提取出能够跨越不同物理形态的通用动作语言,并让机器人学会控制。这背后是一套精妙的技术组合。
核心方法
DreamDojo的核心创新在于引入了“连续潜在动作”。不同于以往依赖特定硬件手套标记或离散的手部姿态估计,该方法通过一个名为Latent Action VAE的模块,自动从视频前后帧中解耦出连续、平滑的动作意图。
这种连续的潜在空间能更好地映射不同形态机器人(如机械臂、人形机器人)之间的动作差异,使得模型学到的动作更具通用性。通过信息瓶颈压缩时空特征,模型得以聚焦于最本质的交互语义。
数据与规模
训练数据是实现通用性的关键。研究团队构建了包含44,711小时视频的DreamDojo-HV数据集,其规模是现有最大数据集的96倍,为模型学习世界物理规律提供了充足的“养料”。
为了平衡数据的多样性与质量,团队采用了混合策略,按1:2:10的比例混合了实验室环境下的In-lab数据、专注灵巧操作的EgoDex数据以及大量野外环境的DreamDojo-HV数据,最大化覆盖现实世界的复杂场景。
效果验证
消融实验清晰地证明了各项技术的有效性。在引入潜在动作后,模型的PSNR指标从20.797提升至20.913。而加入时序一致性Loss后,在反事实评估上的PSNR更是从19.482大幅提升至20.980。
一个关键发现是:仅仅被动观看视频,模型只能学到物理世界的表象规律;只有引入潜在动作,模型才能真正理解“指令”与“动作”之间的因果关系,从而具备可控制性。
局限与展望
目前,DreamDojo在模拟极快或极长尾动作(如快速挥手)时仍会产生一定的视觉伪影,这是技术迭代的方向之一。未来的工作计划结合强化学习(RL),让模型能够进行大规模的策略评估和自我进化,进一步提升其在复杂任务中的表现和鲁棒性。
NVIDIA的DreamDojo不仅是一个技术模型,更揭示了具身智能 Scaling Law 的新可能:通过海量人类视频和潜在动作,可以低成本地驱动机器人智能进化。当机器人能像人一样通过观察学习,未来还有哪些边界将被打破?