具身智能的VLA模型常因缺乏对环境规律的理解而受限。FRAPPE框架的提出,通过引入隐式世界模型能力,让机器人不再死记硬背动作。它利用多未来表征对齐技术,实现了数据效率的飞跃,使得小模型也能超越大模型,并在真实任务中展现出强大的泛化能力。
智能速览
FRAPPE通过多未来表征对齐,赋予VLA模型隐式世界模型能力。
其训练框架分两步,通过引入并行专家模块实现参数高效提升。
该方法能利用无动作标签的人类第一视角视频进行训练,数据效率高。
130M参数的小模型在RoboTwin基准上超越了1B参数的竞品。
在倒水、擦桌子等真实机器人任务中,FRAPPE展现出极强的泛化性。
精华内容
FRAPPE的核心突破在于其独特的训练哲学,它并非简单地增加模型参数,而是通过巧妙地对齐视觉表征,让模型学会理解世界变化的内在规律,从而实现智能上的跃迁。
隐式世界建模
传统的视觉-语言-动作(VLA)模型倾向于死记硬背动作序列,这限制了它们在新场景中的泛化能力。FRAPPE通过引入“隐式世界模型”的概念解决了这一瓶颈。它不再直接记忆动作,而是转而学习环境变化的“规律”。这是通过将多个强大的视觉大模型(例如DINOv2和SigLIP)预测的未来视觉表征进行对齐来实现的,让模型对物理世界有了更深入的理解。
两阶段高效训练
FRAPPE的训练框架被设计得既强大又高效。第一阶段是“Mid-Training”,专注于对齐单个视觉编码器的未来表征。第二阶段是“Post-Training”,也称为MiPA(多未来表征对齐)。在此阶段,框架引入了并行专家模块(使用LoRA),使模型能够集成和整合来自多个视觉编码器的知识,而无需进行完全重新训练,从而实现了参数高效的性能飞跃。
小模型逆袭大模型
FRAPPE的有效性在严格的基准测试中得到了证明。在RoboTwin仿真基准上,它实现了新的SOTA(state-of-the-art)。最引人注目的是,一个仅有130M参数的FRAPPE小型模型,成功超越了拥有1B参数的、大得多的RDT-1B模型。这表明,智能能力的提升不仅仅源于规模,更源于训练数据的质量和学习机制的有效性。
真实世界泛化力
除了仿真环境,FRAPPE的能力还成功转化到了真实世界的机器人任务中。在倒水、擦桌子和物体分类等任务中,该模型展现出极强的泛化能力,能够处理未见过的物体和多样的环境。这得益于其从无动作标签的人类第一视角视频(Egocentric data)中学习的能力,这种数据来源丰富,使训练过程更加高效和贴近现实。
FRAPPE的成功为具身智能的发展开辟了新路径,证明了融合视觉大模型的知识是提升机器人通用性的关键。这启示我们,未来的突破或许更依赖于训练范式的创新,而非无止境地堆砌模型规模。这将如何改变我们设计机器人的方式?