DREAMZERO作为英伟达提出的14B参数机器人基础模型,引入世界动作模型架构,利用视频扩散先验实现零样本泛化。该技术突破了传统VLA模型的局限,在跨环境、跨任务及跨具身场景中展现出强大的适应能力与执行效率。
智能速览
提出世界动作模型架构,联合预测视频和动作,实现零样本策略
在跨环境和任务泛化基准上,平均任务进度比先进VLA提升超2倍
通过系统、实现和模型级优化,实现38倍推理加速,支持实时控制
证明仅需多样异构数据即可学习通用策略,无需重复演示
实现跨具身迁移能力,利用纯视频数据提升未见任务表现
精华内容
DREAMZERO通过联合预测未来视觉状态和动作,将机器人控制转化为逆动力学问题,从而解锁了前所未有的泛化潜力。
架构革新与预测机制
DREAMZERO建立在预训练图像到视频扩散模型之上,参数规模达140亿。其核心是世界动作模型架构,旨在以对齐方式同时预测动作和视觉未来状态。该方法将动作学习从密集的状态-动作模仿转变为逆动力学,通过联合生成未来帧和动作,利用丰富的时空先验。实验数据显示,相比最先进的预训练VLA模型,在环境和任务泛化基准上的平均任务进度提升了超过2倍。
实时执行与系统优化
针对视频扩散模型固有的计算开销,研究团队引入了涵盖系统、实现和模型三个层面的优化技术。通过异步闭环执行、CFG并行、DiT缓存以及应用Torch Compile和CUDA Graphs等手段,配合Flash训练策略解耦噪声调度,最终实现了38倍的推理加速。这使得推理延迟从5.7秒大幅降至150毫秒,模型能以约7Hz的频率生成动作块,实现平滑的实时机器人控制。
零样本泛化与跨具身迁移
在零样本泛化测试中,DREAMZERO在解开鞋带、熨烫等未见任务上平均达到39.5%的任务进度,显著优于接近零进度的从零开始的VLA模型。此外,该模型展示了跨具身迁移能力,仅需使用双臂YAM机器人的数据或以自我为中心的人类视频进行微调,即可提升未见任务的表现。实验证明,仅凭10-20分钟的纯视频数据,就能为机器人带来持续的性能改进。
数据多样性与规模效应
研究证实,多样性的数据能显著提高模型泛化能力。在500小时对比实验中,多样数据训练的模型在泛化表现上比重复数据高出17个百分点。同时,WAM展现出清晰的规模效应,14B模型在任务进度上达到50%,远超5B模型的21%。扩大模型规模有效减少了视觉幻觉及其导致的错误动作,而单纯增加VLA的容量并未解决其在多样数据分布上的困难。
DREAMZERO验证了世界动作模型在具身智能领域的巨大潜力,不仅显著提升了实时控制能力,更打破了传统方法对大量重复演示数据的依赖。未来随着视频骨干网络的改进,机器人有望直接从海量人类视频中汲取经验,实现更广泛的技能迁移。