张大妈

英伟达两篇论文提出具身智能新范式,有哪些突破和意义?

源自知乎:EDPJ

02-27 13:15

DREAMZERO作为英伟达提出的14B参数机器人基础模型,引入世界动作模型架构,利用视频扩散先验实现零样本泛化。该技术突破了传统VLA模型的局限,在跨环境、跨任务及跨具身场景中展现出强大的适应能力与执行效率。

英伟达两篇论文提出具身智能新范式,有哪些突破和意义?智能速览

  • 提出世界动作模型架构,联合预测视频和动作,实现零样本策略

  • 在跨环境和任务泛化基准上,平均任务进度比先进VLA提升超2倍

  • 通过系统、实现和模型级优化,实现38倍推理加速,支持实时控制

  • 证明仅需多样异构数据即可学习通用策略,无需重复演示

  • 实现跨具身迁移能力,利用纯视频数据提升未见任务表现

英伟达两篇论文提出具身智能新范式,有哪些突破和意义?精华内容

DREAMZERO通过联合预测未来视觉状态和动作,将机器人控制转化为逆动力学问题,从而解锁了前所未有的泛化潜力。

架构革新与预测机制

DREAMZERO建立在预训练图像到视频扩散模型之上,参数规模达140亿。其核心是世界动作模型架构,旨在以对齐方式同时预测动作和视觉未来状态。该方法将动作学习从密集的状态-动作模仿转变为逆动力学,通过联合生成未来帧和动作,利用丰富的时空先验。实验数据显示,相比最先进的预训练VLA模型,在环境和任务泛化基准上的平均任务进度提升了超过2倍。

实时执行与系统优化

针对视频扩散模型固有的计算开销,研究团队引入了涵盖系统、实现和模型三个层面的优化技术。通过异步闭环执行、CFG并行、DiT缓存以及应用Torch Compile和CUDA Graphs等手段,配合Flash训练策略解耦噪声调度,最终实现了38倍的推理加速。这使得推理延迟从5.7秒大幅降至150毫秒,模型能以约7Hz的频率生成动作块,实现平滑的实时机器人控制。

零样本泛化与跨具身迁移

在零样本泛化测试中,DREAMZERO在解开鞋带、熨烫等未见任务上平均达到39.5%的任务进度,显著优于接近零进度的从零开始的VLA模型。此外,该模型展示了跨具身迁移能力,仅需使用双臂YAM机器人的数据或以自我为中心的人类视频进行微调,即可提升未见任务的表现。实验证明,仅凭10-20分钟的纯视频数据,就能为机器人带来持续的性能改进。

数据多样性与规模效应

研究证实,多样性的数据能显著提高模型泛化能力。在500小时对比实验中,多样数据训练的模型在泛化表现上比重复数据高出17个百分点。同时,WAM展现出清晰的规模效应,14B模型在任务进度上达到50%,远超5B模型的21%。扩大模型规模有效减少了视觉幻觉及其导致的错误动作,而单纯增加VLA的容量并未解决其在多样数据分布上的困难。

DREAMZERO验证了世界动作模型在具身智能领域的巨大潜力,不仅显著提升了实时控制能力,更打破了传统方法对大量重复演示数据的依赖。未来随着视频骨干网络的改进,机器人有望直接从海量人类视频中汲取经验,实现更广泛的技能迁移。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐