传统VLA模型一直受困于只会模仿不会推理的瓶颈,NVIDIA推出的DreamZero框架通过世界动作模型实现了预测未来视频与生成动作的端到端协同,在零样本泛化、跨机器人适配、实时部署三大维度实现突破,为通用型机器人操作提供了全新技术路径。
智能速览
DreamZero构建世界动作模型,实现视觉未来与动作序列深度绑定
通过三级优化将推理延迟从5.7秒降至150毫秒,支持7Hz实时控制
多样化非重复数据训练效果优于传统结构化重复数据
零样本性能超SOTA VLA模型2倍,跨机器人适配仅需30分钟数据
从模仿学习转向预测学习,重构机器人决策范式
精华内容
DreamZero的核心突破在于重构了机器人决策范式,通过预测未来视觉状态与对齐动作序列的双目标设计,让模型真正具备物理世界理解能力。
架构革新
DreamZero摒弃了VLA模型视觉-动作的直接映射逻辑,构建以世界建模为核心的WAM架构。该架构包含视频分支和动作分支,共享骨干网络参数,确保动作与视觉结果在物理时空上完全对齐。例如预测握手未来视频后,动作分支会生成符合人体工学的手臂抬起、握持、摆动序列,实现从理解场景到规划动作的完整逻辑链。
实时优化
针对视频扩散模型的高延迟问题,DreamZero通过算法-系统-实现三级优化实现38倍提速。算法层面解耦视频与动作去噪时序,扩散步数从4减至1,速度提升2.33倍;系统层面采用CFG并行和DiT缓存,累计提升5.4倍;实现层面通过Torch Compile、NVFP4量化和内核优化,在GB200平台实现38倍提速,支持7Hz实时闭环控制。
数据突破
实验证明,DreamZero颠覆了传统机器人学习对结构化重复数据的依赖。使用多样化非重复数据训练,效果显著优于传统重复演示数据。在500小时训练数据下,DreamZero在AgiBot G1和Franka机器人上的平均任务进度达到0.68,远超GR00T N1.6的0.33,证明异质化数据更能提升泛化能力。
跨平台适配
DreamZero展现了卓越的跨机器人迁移能力,仅需30分钟纯视频数据即可适配新机器人。由于WAM学习的是视觉未来到动作的映射,而非直接观测到动作的映射,只需少量数据调整形态相关参数即可适配不同硬件。实验显示,从双臂到单臂的迁移成功率保持在85%以上,动作平滑度优于传统方案22%。
性能对比
在零样本泛化测试中,DreamZero平均性能超SOTA VLA模型2倍。面对未见过任务如将汉堡扇凉、把泰迪熊放好等,成功率提升至76%,而传统VLA模型仅为35%。在推理效率方面,单动作chunk处理时间从5.7秒降至150毫秒,实时性提升38倍,为实际部署奠定基础。