当前顶尖的视觉-语言-动作模型虽能理解语义,但在陌生环境中掌握物理运动的能力却很弱。英伟达提出的DreamZero模型另辟蹊径,通过预测未来视频与动作来学习物理规律,成功让机器人在新任务和新环境中的泛化性能提升超过两倍,为具身智能的发展开辟了新路径。
智能速览
DreamZero是一种世界动作模型,通过预测视频与动作学习物理规律。
该模型解决了顶尖VLA模型在未知环境中物理泛化能力弱的痛点。
真实机器人实验显示,其泛化性能比最优VLA模型提升超过两倍。
140亿参数模型通过优化,实现了7赫兹的实时闭环控制。
仅需10分钟视频数据训练,未知任务性能即可获得超42%的相对提升。
模型支持少样本具身适配,30分钟试玩数据即可迁移到新机器人。
精华内容
传统VLA模型依赖大量演示数据,而DreamZero的世界模型方法如何实现对物理规律的深度学习并实现突破?以下将从其核心原理、性能表现和迁移能力三个维度展开。
革新范式
当前主流的视觉-语言-动作(VLA)模型虽然擅长理解指令,但在面对全新环境时,对未知物理运动的泛化能力有限。DreamZero模型则采用了世界动作模型(WAM)这一新范式,它不直接学习动作,而是通过预测未来的世界状态,即以视频作为密集表征,来学习底层的物理动力学规律。这种方法让模型能够从异构机器人数据中高效学习多样技能,无需依赖重复的演示数据,从根源上提升了泛化能力。
性能飞跃
在真实机器人的实验中,DreamZero的价值得到了验证。相较于当前最先进的VLA模型,DreamZero在新任务和新环境下的泛化性能提升超过了两倍,这是一个巨大的进步。更关键的是,英伟达通过模型与系统层面的双重优化,成功将一个拥有140亿参数的自回归视频扩散模型部署运行,实现了7赫兹的实时闭环控制。这意味着该技术已具备在实际场景中快速响应和操作的能力。
灵活迁移
DreamZero的另一个亮点是其强大的迁移能力。研究验证了两种有效的跨具身迁移方式。第一种是零样本迁移,仅利用其他机器人或人类的纯视频演示数据,配合10至20分钟的训练,就能让模型在未知任务上的性能实现超过42%的相对提升。第二种是少样本适配,仅用30分钟的试玩数据,就能让模型快速适应到新的机器人形态上,同时保留原有的零样本泛化特性,极大地降低了部署成本。
英伟达的DreamZero模型通过世界动作模型的创新思路,有效解决了传统VLA模型在物理泛化上的短板,不仅在性能上实现了翻倍提升,更在迁移能力和实时性上展现了巨大潜力。这项工作为如何让机器人真正理解和适应物理世界提供了新的解决方案,未来具身智能将走向何方?