当前位置:
AIGC文章详情

张大妈

CMU&Meta: 统一VLA高效后训练全新范式

源自小红薯:每日ComputerScience

02-04 20:53

Vision-Language-Action 模型在处理多样化任务时常遭遇优化崩溃与成本过高的瓶颈。来自 CMU 与 Meta 的 MetaVLA 框架另辟蹊径,通过一个轻量级的元推理模块,在不改动模型主干的前提下,实现了统一且高效的多任务后训练。这一新范式不仅解决了泛化难题,更大幅提升了训练效率,为具身智能的持续学习开辟了新可能。

CMU&Meta: 统一VLA高效后训练全新范式智能速览

  • MetaVLA 实现了“一模型多任务”的统一后训练范式,避免了为每个任务单独训练模型的高昂成本。

  • 其核心是轻量级的 MAR 元推理模块,通过建模函数空间解决了朴素多任务训练中的性能崩塌问题。

  • 在 LIBERO 基准测试中,训练步数缩短约 69%,GPU 时长减少约 76%,平均成功率提升 4.4%。

  • 该框架与模型主干无关,可即插即用于 OpenVLA 等现有模型,推理开销几乎可忽略不计。

  • MetaVLA 为具身智能模型持续学习新技能、不断注入新数据提供了可行的解决方案。

CMU&Meta: 统一VLA高效后训练全新范式精华内容

MetaVLA 的突破并非源于对模型架构的颠覆性改造,而是通过巧妙的“元推理”设计,在现有 VLA 模型之上构建了一个高效的协同学习层。其核心机制与优势体现在以下几个方面:

统一训练新范式

传统 VLA 模型在面临领域差异大的多任务时,要么为每个任务单独训练模型,导致资源浪费和能力隔离;要么人工筛选相近任务协同训练,引入偏见且难以规模化。MetaVLA 提出的统一后训练框架,将所有目标任务整合进一次训练过程,采用 Context-Aware Meta Co-Training 机制,真正实现了“one-for-all”的高效范式,从根本上解决了模型数量膨胀和资源消耗问题。

MAR 元推理模块

框架的核心是 Meta-Action-Reasoner (MAR) 模块,一个基于 Attentive Neural Processes 的轻量级元推理器。它首先通过上下文记忆库对高异构的辅助任务进行先验函数空间建模,再利用 ELBO 优化对所有目标任务的后验函数进行精准学习。这种设计巧妙地将辅助任务作为“条件信息”而非直接监督信号,从而有效避免了朴素多任务监督微调因分布冲突而导致的性能崩塌,保证了优化的稳定性。

训练效率显著提升

MetaVLA 在效率上取得了令人瞩目的成果。在标准的 LIBERO 基准测试中,与 OpenVLA 基线相比,其训练步数从 24 万步缩短至 7.5 万步,降幅约 69%。GPU 总训练时长从 100 小时减少到 24 小时,节省了约 76% 的计算成本。在效率大幅提升的同时,模型平均成功率还提高了 4.4%,在长时序任务上最高提升幅度更是达到了 8.0%,实现了降本增效的双重目标。

工程友好与可扩展性

MetaVLA 框架具有出色的工程友好性,它不依赖任何特定的模型主干,可以作为一种插件式模块直接应用于 OpenVLA、NORA 等现有模型。在推理阶段,其引入的计算开销极低,仅增加约 0.3 毫秒每令牌,几乎不影响部署性能。更重要的是,该框架能够规模化引入来自不同领域(如视角、自由度差异巨大的 GR00T 数据集)的辅助任务,无需昂贵的人工筛选,为通用具身智能的持续学习和能力进化提供了坚实的理论与实践基础。

MetaVLA 框架通过其独特的元推理设计,成功攻克了多任务 VLA 训练的诸多痛点,实现了效率与性能的双重突破。它不仅为当前模型训练提供了一种更为经济、稳定的方案,更展望了通用具身智能模型持续学习、不断进化的未来。这是否预示着机器人学习进入了一个新的发展阶段?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章