英伟达推出的DreamZero模型,正在改变机器人学习的方式。它通过联合预测视频与动作,让机器人在新环境和任务中展现出强大的零样本泛化能力,显著减少了对大量演示数据的依赖,为开放世界机器人控制提供了全新的解决思路。
智能速览
DreamZero是一个14B参数的世界动作模型,联合预测视频与动作。
核心创新在于通过视频扩散学习世界物理动态,而非简单模仿。
在未知任务中的泛化能力比主流VLA模型高出两倍以上。
通过三层优化实现38倍推理加速,达到7Hz实时控制。
仅需10-20分钟的视频数据即可完成跨机器人适配,性能提升超42%。
模型代码与权重已开源,推动社区发展。
精华内容
DreamZero的核心突破,在于它如何让机器人“看懂”世界并预测未来。这并非简单的指令执行,而是一种对物理世界动态的深层理解,让我们深入其技术架构。
视频动作联合预测
DreamZero并非传统的视觉语言动作模型,而是一个14B参数的世界动作模型。其核心创新在于联合预测视频帧与动作序列,通过这种视频扩散的方式,让机器人学习世界的物理动态,而非简单地模仿状态-动作对。
模型输入包含语言指令、当前视觉观测及本体感受状态。其自回归架构配合KV缓存设计,能够保留原生帧率,确保多模态信息在推理过程中的精准对齐,有效避免误差累积。
三层优化实现实时推理
为了让模型在真实机器人上高效运行,DreamZero在三个层面进行了极致优化。首先是算法层面的DreamZero Flash,它将视频与动作的调度解耦,更好地适应流式推理。
其次是系统级优化,包括CFG并行和DiT缓存等策略。最后是底层优化,通过量化和Q短内核调优来提升硬件效率。这三层优化叠加,最终实现了高达38倍的推理加速,达到了7赫兹的实时闭环控制能力。
强大的泛化与迁移能力
在真实机器人实验中,DreamZero展现了卓越的泛化能力。面对未知任务和新环境,其表现比现有主流VLA模型高出两倍以上,真正实现了高效的零样本任务适配。
在跨机器人迁移方面,仅需10到20分钟的目标机器人或人类演示视频,就能让性能提升超过42%。甚至仅用30分钟的“玩耍”数据,即可完成新载体的适配,且同时保持原有的零样本泛化能力,应用价值显著。
DreamZero通过视频扩散重新定义了机器人基础模型,大幅降低了对海量数据的依赖。这不仅提升了机器人学习的效率,也为在更开放、复杂的场景中部署智能体铺平了道路。当机器人能像人一样通过观察学习,我们离通用人工智能还有多远?