针对现有机器人模型在未知环境泛化能力弱、推理速度慢的痛点,英伟达提出了世界动作模型(WAM)新范式。该方案通过端到端联合预测未来视频与动作,不仅实现了38倍推理加速,达成7Hz实时控制,更在零样本任务中表现优异,为具身智能的发展提供了强有力的技术支撑。
智能速览
传统VLA模型缺乏物理建模,难以执行未见过的动作。
英伟达WAM模型端到端联合预测视频与动作,解决阶段失配。
模型推理速度提升38倍,成功实现7Hz实时闭环控制。
零样本泛化性能较顶尖VLA提升2倍,支持跨本体迁移。
项目已开源模型权重、代码及全套基准测试工具。
精华内容
面对传统模型在物理交互与实时控制上的双重挑战,英伟达通过创新的WAM架构,重新定义了机器人面对未知世界的反应机制。
攻克技术瓶颈
现有主流视觉-语言-动作(VLA)模型虽然在语义理解上表现出色,但在物理动力学和几何空间关系的建模上存在明显短板。若训练数据中缺乏特定动作示范,模型便无法执行。此外,传统世界模型面临视频与动作预测失配的问题,且推理速度慢,无法满足机器人实时控制的需求。英伟达提出的WAM新范式,通过端到端联合预测未来视频与动作,有效解决了阶段失配问题。
实现极速推理
为了让140亿参数的大模型适配机器人闭环控制,研究团队在工程上取得了重大突破。通过对算法的深度优化,模型实现了38倍的推理加速,将动作控制频率提升至7Hz。这一速度成功突破了视频扩散模型的工程瓶颈,使其能够满足机器人实时操作的要求,为具身智能的落地应用扫清了关键障碍。
强化泛化能力
在核心的泛化能力上,WAM模型展现了惊人的实力。其零样本泛化性能较顶尖VLA模型提升了2倍以上,这意味着机器人无需针对特定任务进行大量训练,即可适应未知环境。该模型支持跨机器人本体和跨环境的高效迁移,仅需通过多样化机器人视频数据,便能实现对未知任务的有效执行。
局限与展望
尽管WAM表现优异,但目前仍存在局限性。在面对长时复杂任务或亚厘米级高精度操作时,性能会有所下降,且对算力仍有较高依赖。未来的研究方向将聚焦于引入大规模真实人类视频数据,以及开发轻量化模型以适配边缘设备。此外,结合System 2规划器,进一步提升人形机器人的适配能力也是重点方向。
英伟达WAM模型通过联合预测与极速推理,显著提升了机器人的环境适应能力,加速了具身智能向通用化发展的进程。随着开源社区的参与和技术的迭代,未来机器人能否像人类一样灵活应对各种未知挑战,值得期待。