张大妈

英伟达DreamDojo:用海量视频教会机器人物理常识

源自小红薯:iTechTokAI

02-12 10:05

NVIDIA联手顶尖学府发布通用机器人世界模型DreamDojo,旨在解决机器人训练中长期存在的带标签数据匮乏问题。该模型利用海量无标签人类视频学习物理常识,为具身智能的发展提供了全新范式,展现出巨大的潜力与价值。

英伟达DreamDojo:用海量视频教会机器人物理常识智能速览

  • DreamDojo是一个基于44000小时人类视频训练的通用机器人世界模型。

  • 通过“潜动作”机制,模型能从未标记的视频中学习物理交互规律。

  • 仅用少量机器人数据微调,便实现了出色的动作可控性与物理理解力。

  • 借助蒸馏管线,模型达到10.81 FPS的实时推理速度,可快速“推演”未来。

  • 该范式为解决开放世界中的长程复杂任务提供了全新解题思路。

英伟达DreamDojo:用海量视频教会机器人物理常识精华内容

机器人如何高效学习物理常识?DreamDojo通过一种创新范式,展示了如何从海量的互联网人类视频中汲取智慧,为机器人打开一扇理解世界的新大门。

海量数据基座

DreamDojo的基石是前所未有的庞大数据量。研究团队使用了长达44,000小时的人类第一视角(Egocentric)视频进行预训练,这不仅是当前用于世界模型训练的最大规模视频数据集,更因其第一视角的特性,涵盖了极为丰富的日常场景与人类灵巧操作技能,为模型理解物理世界提供了坚实基础。

潜动作机制

传统机器人训练高度依赖带标签数据,而DreamDojo的核心突破在于“潜动作”机制的提出。该机制巧妙地将连续的“潜动作”作为代理,让模型能够直接从无标签的人类视频中自主学习和理解物理交互规律,随后仅需少量真实的机器人数据进行微调,便能实现惊人的物理理解力与动作可控性,极大降低了数据获取门槛。

实时推演能力

除了强大的学习能力,DreamDojo在执行效率上也表现出色。通过独创的蒸馏管线,该模型实现了10.81 FPS的实时推理速度。这意味着它不仅能“看懂”当前所处的物理环境,还能在脑海中进行高速的动态仿真,快速“推演”接下来的行为可能带来的结果,这对于规划长程任务至关重要。

DreamDojo的成功验证了利用互联网海量视频构建机器人“物理常识”的可行性。这种从“观察人类”到“指导机器人”的范式转变,或将加速通用人形机器人的到来,让它们更好地适应并服务于复杂的真实世界。下一个里程碑会是什么?

精选参考来源

【行业重磅】| 英伟达发布通用机器人世界模型 DreamDojo NVIDIA 联手 HKUST、UC Berkeley、Stanford 等顶尖机构,刚刚发布最新研究成果 DreamDojo —— 一个基于大规模人类视频训练的通用机器人世界模型。 🤖 核心突破:数据与泛化的降维打击 长期以来,机器人研究受困于带标签(Action-labeled)数据的匮乏。DreamDojo 的出现打破了这一僵局: 1. 海量数据基座: 使用了 44,000 小时 的人类第一视角(Egocentric)视频进行预训练。这是迄今为止用于世界模型训练的最大规模视频数据集,涵盖了极其丰富的日常场景和灵巧操作技能。 2. Latent Actions(潜动作)机制: 针对人类视频缺乏具体动作指令(Action Labels)的痛点,论文提出了一种连续的“潜动作”作为代理,让模型能从无标签视频中学习物理交互规律,再通过少量机器人数据进行微调(Post-training),实现了惊人的物理理解力和动作可控性。 3. 实时仿真能力: 借助独创的蒸馏管线(Distillation Pipeline),DreamDojo 实现了 10.81 FPS 的实时推理速度,不仅能“看懂”物理世界,还能在脑海中快速“推演”未来。 💡 行业启示 DreamDojo 证明了我们可以利用互联网上无限的人类视频资源来构建机器人的“物理常识”。这种从“观察人类”到“指导机器人”的范式(Generalist World Model),为解决开放世界中接触丰富(Contact-rich)的长程任务提供了全新的解题思路。 📄 来源 Reference • Paper: DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos • ArXiv: 2602.06949 #机器人[话题]# #人工智能[话题]# #NVIDIA[话题]# #世界模型[话题]# #WorldModel[话题]# #具身智能[话题]# #EmbodiedAI[话题]# #前沿科技[话题]# #深度学习[话题]# #DreamDojo[话题]#
内容由AI生成

精选参考来源

【行业重磅】| 英伟达发布通用机器人世界模型 DreamDojo NVIDIA 联手 HKUST、UC Berkeley、Stanford 等顶尖机构,刚刚发布最新研究成果 DreamDojo —— 一个基于大规模人类视频训练的通用机器人世界模型。 🤖 核心突破:数据与泛化的降维打击 长期以来,机器人研究受困于带标签(Action-labeled)数据的匮乏。DreamDojo 的出现打破了这一僵局: 1. 海量数据基座: 使用了 44,000 小时 的人类第一视角(Egocentric)视频进行预训练。这是迄今为止用于世界模型训练的最大规模视频数据集,涵盖了极其丰富的日常场景和灵巧操作技能。 2. Latent Actions(潜动作)机制: 针对人类视频缺乏具体动作指令(Action Labels)的痛点,论文提出了一种连续的“潜动作”作为代理,让模型能从无标签视频中学习物理交互规律,再通过少量机器人数据进行微调(Post-training),实现了惊人的物理理解力和动作可控性。 3. 实时仿真能力: 借助独创的蒸馏管线(Distillation Pipeline),DreamDojo 实现了 10.81 FPS 的实时推理速度,不仅能“看懂”物理世界,还能在脑海中快速“推演”未来。 💡 行业启示 DreamDojo 证明了我们可以利用互联网上无限的人类视频资源来构建机器人的“物理常识”。这种从“观察人类”到“指导机器人”的范式(Generalist World Model),为解决开放世界中接触丰富(Contact-rich)的长程任务提供了全新的解题思路。 📄 来源 Reference • Paper: DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos • ArXiv: 2602.06949 #机器人[话题]# #人工智能[话题]# #NVIDIA[话题]# #世界模型[话题]# #WorldModel[话题]# #具身智能[话题]# #EmbodiedAI[话题]# #前沿科技[话题]# #深度学习[话题]# #DreamDojo[话题]#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐