张大妈

英伟达推出DreamZero!开启VLA零样本时代 #青稞社区 #英伟达 #机器人 #WAM #VLA

源自抖音:青稞社区

02-26 10:59

英伟达推出的DreamZero模型,正在改变机器人学习的方式。它通过联合预测视频与动作,让机器人在新环境和任务中展现出强大的零样本泛化能力,显著减少了对大量演示数据的依赖,为开放世界机器人控制提供了全新的解决思路。

英伟达推出DreamZero!开启VLA零样本时代 #青稞社区 #英伟达 #机器人 #WAM #VLA智能速览

  • DreamZero是一个14B参数的世界动作模型,联合预测视频与动作。

  • 核心创新在于通过视频扩散学习世界物理动态,而非简单模仿。

  • 在未知任务中的泛化能力比主流VLA模型高出两倍以上。

  • 通过三层优化实现38倍推理加速,达到7Hz实时控制。

  • 仅需10-20分钟的视频数据即可完成跨机器人适配,性能提升超42%。

  • 模型代码与权重已开源,推动社区发展。

英伟达推出DreamZero!开启VLA零样本时代 #青稞社区 #英伟达 #机器人 #WAM #VLA精华内容

DreamZero的核心突破,在于它如何让机器人“看懂”世界并预测未来。这并非简单的指令执行,而是一种对物理世界动态的深层理解,让我们深入其技术架构。

视频动作联合预测

DreamZero并非传统的视觉语言动作模型,而是一个14B参数的世界动作模型。其核心创新在于联合预测视频帧与动作序列,通过这种视频扩散的方式,让机器人学习世界的物理动态,而非简单地模仿状态-动作对。

模型输入包含语言指令、当前视觉观测及本体感受状态。其自回归架构配合KV缓存设计,能够保留原生帧率,确保多模态信息在推理过程中的精准对齐,有效避免误差累积。

三层优化实现实时推理

为了让模型在真实机器人上高效运行,DreamZero在三个层面进行了极致优化。首先是算法层面的DreamZero Flash,它将视频与动作的调度解耦,更好地适应流式推理。

其次是系统级优化,包括CFG并行和DiT缓存等策略。最后是底层优化,通过量化和Q短内核调优来提升硬件效率。这三层优化叠加,最终实现了高达38倍的推理加速,达到了7赫兹的实时闭环控制能力。

强大的泛化与迁移能力

在真实机器人实验中,DreamZero展现了卓越的泛化能力。面对未知任务和新环境,其表现比现有主流VLA模型高出两倍以上,真正实现了高效的零样本任务适配。

在跨机器人迁移方面,仅需10到20分钟的目标机器人或人类演示视频,就能让性能提升超过42%。甚至仅用30分钟的“玩耍”数据,即可完成新载体的适配,且同时保持原有的零样本泛化能力,应用价值显著。

DreamZero通过视频扩散重新定义了机器人基础模型,大幅降低了对海量数据的依赖。这不仅提升了机器人学习的效率,也为在更开放、复杂的场景中部署智能体铺平了道路。当机器人能像人一样通过观察学习,我们离通用人工智能还有多远?

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐