张大妈

具身智能新SOTA:FRAPPE世界模型能力注入

源自小红薯:陳龍龖龘

02-28 12:56

具身智能的VLA模型常因缺乏对环境规律的理解而受限。FRAPPE框架的提出,通过引入隐式世界模型能力,让机器人不再死记硬背动作。它利用多未来表征对齐技术,实现了数据效率的飞跃,使得小模型也能超越大模型,并在真实任务中展现出强大的泛化能力。

具身智能新SOTA:FRAPPE世界模型能力注入智能速览

  • FRAPPE通过多未来表征对齐,赋予VLA模型隐式世界模型能力。

  • 其训练框架分两步,通过引入并行专家模块实现参数高效提升。

  • 该方法能利用无动作标签的人类第一视角视频进行训练,数据效率高。

  • 130M参数的小模型在RoboTwin基准上超越了1B参数的竞品。

  • 在倒水、擦桌子等真实机器人任务中,FRAPPE展现出极强的泛化性。

具身智能新SOTA:FRAPPE世界模型能力注入精华内容

FRAPPE的核心突破在于其独特的训练哲学,它并非简单地增加模型参数,而是通过巧妙地对齐视觉表征,让模型学会理解世界变化的内在规律,从而实现智能上的跃迁。

隐式世界建模

传统的视觉-语言-动作(VLA)模型倾向于死记硬背动作序列,这限制了它们在新场景中的泛化能力。FRAPPE通过引入“隐式世界模型”的概念解决了这一瓶颈。它不再直接记忆动作,而是转而学习环境变化的“规律”。这是通过将多个强大的视觉大模型(例如DINOv2和SigLIP)预测的未来视觉表征进行对齐来实现的,让模型对物理世界有了更深入的理解。

两阶段高效训练

FRAPPE的训练框架被设计得既强大又高效。第一阶段是“Mid-Training”,专注于对齐单个视觉编码器的未来表征。第二阶段是“Post-Training”,也称为MiPA(多未来表征对齐)。在此阶段,框架引入了并行专家模块(使用LoRA),使模型能够集成和整合来自多个视觉编码器的知识,而无需进行完全重新训练,从而实现了参数高效的性能飞跃。

小模型逆袭大模型

FRAPPE的有效性在严格的基准测试中得到了证明。在RoboTwin仿真基准上,它实现了新的SOTA(state-of-the-art)。最引人注目的是,一个仅有130M参数的FRAPPE小型模型,成功超越了拥有1B参数的、大得多的RDT-1B模型。这表明,智能能力的提升不仅仅源于规模,更源于训练数据的质量和学习机制的有效性。

真实世界泛化力

除了仿真环境,FRAPPE的能力还成功转化到了真实世界的机器人任务中。在倒水、擦桌子和物体分类等任务中,该模型展现出极强的泛化能力,能够处理未见过的物体和多样的环境。这得益于其从无动作标签的人类第一视角视频(Egocentric data)中学习的能力,这种数据来源丰富,使训练过程更加高效和贴近现实。

FRAPPE的成功为具身智能的发展开辟了新路径,证明了融合视觉大模型的知识是提升机器人通用性的关键。这启示我们,未来的突破或许更依赖于训练范式的创新,而非无止境地堆砌模型规模。这将如何改变我们设计机器人的方式?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐