NVIDIA联手顶尖学府发布通用机器人世界模型DreamDojo,旨在解决机器人训练中长期存在的带标签数据匮乏问题。该模型利用海量无标签人类视频学习物理常识,为具身智能的发展提供了全新范式,展现出巨大的潜力与价值。
智能速览
DreamDojo是一个基于44000小时人类视频训练的通用机器人世界模型。
通过“潜动作”机制,模型能从未标记的视频中学习物理交互规律。
仅用少量机器人数据微调,便实现了出色的动作可控性与物理理解力。
借助蒸馏管线,模型达到10.81 FPS的实时推理速度,可快速“推演”未来。
该范式为解决开放世界中的长程复杂任务提供了全新解题思路。
精华内容
机器人如何高效学习物理常识?DreamDojo通过一种创新范式,展示了如何从海量的互联网人类视频中汲取智慧,为机器人打开一扇理解世界的新大门。
海量数据基座
DreamDojo的基石是前所未有的庞大数据量。研究团队使用了长达44,000小时的人类第一视角(Egocentric)视频进行预训练,这不仅是当前用于世界模型训练的最大规模视频数据集,更因其第一视角的特性,涵盖了极为丰富的日常场景与人类灵巧操作技能,为模型理解物理世界提供了坚实基础。
潜动作机制
传统机器人训练高度依赖带标签数据,而DreamDojo的核心突破在于“潜动作”机制的提出。该机制巧妙地将连续的“潜动作”作为代理,让模型能够直接从无标签的人类视频中自主学习和理解物理交互规律,随后仅需少量真实的机器人数据进行微调,便能实现惊人的物理理解力与动作可控性,极大降低了数据获取门槛。
实时推演能力
除了强大的学习能力,DreamDojo在执行效率上也表现出色。通过独创的蒸馏管线,该模型实现了10.81 FPS的实时推理速度。这意味着它不仅能“看懂”当前所处的物理环境,还能在脑海中进行高速的动态仿真,快速“推演”接下来的行为可能带来的结果,这对于规划长程任务至关重要。
DreamDojo的成功验证了利用互联网海量视频构建机器人“物理常识”的可行性。这种从“观察人类”到“指导机器人”的范式转变,或将加速通用人形机器人的到来,让它们更好地适应并服务于复杂的真实世界。下一个里程碑会是什么?