当前具身智能研究普遍在追逐复杂的模型架构,但一项来自清华与阿里的研究揭示了更底层的真相。它通过严谨的实验证明,VLM的通用问答能力无法预测其控制性能,而为机器人任务专门优化视觉模块,才是突破性能瓶颈的关键。
智能速览
VLM的通用问答能力与机器人控制性能几乎无关。
微调视觉编码器是提升控制性能的关键,语言部分影响不大。
仅用MLP动作头的极简架构,参数增加<1%即可达到SOTA。
现有VLM的视觉特征是为“看图说话”设计,而非“动作规划”。
未来研究应聚焦于Control-relevant的视觉表征。
精华内容
在追逐复杂模型的道路上,一项研究却揭示了机器人控制的真正瓶颈。它并非来自精巧的语言策略,而是根植于基础的视觉感知。
极简方案胜出
该研究提出了一种名为VLM4VLA的极简适配方案,架构异常简单:选取一个现有的VLM作为主干网络,其输出的Action Query Token直接通过一个MLP层转换为最终的动作指令。这种设计摒弃了复杂的扩散策略或精巧的动作头,仅让模型参数增加不到1%,却足以在多个基准测试中取得媲美Pi0等复杂专家模型的SOTA性能,证明了简单方法的有效性。
视觉鸿沟的发现
研究的核心贡献在于通过消融实验揭示了“视觉鸿沟”的存在。实验结果明确显示,当冻结VLM的视觉编码器时,机器人的控制性能会直接崩塌;相反,冻结语言模型部分,性能影响却微乎其微。这表明,当前主流VLM预训练学到的视觉特征是为了“看图说话”等描述性任务优化的,并不适用于需要精确空间感知和动态理解的“动作规划”任务。
训练策略的启示
在训练策略上,研究发现全参数微调是必须的,任何形式的参数冻结都会损害最终性能。同时,研究者采用了简单的L1/L2 Loss和BCE Loss,摒弃了可能引入推理随机性的复杂流匹配方法。这种简洁的训练策略不仅降低了实现难度,还保证了模型输出的稳定性和可控性,为实际部署提供了便利。
未来研究方向
这项研究的结论为具身智能领域指明了新的方向。作者呼吁,研究社区不应再仅仅卷LLM的语言能力,而应将更多精力投入到构建与控制任务强相关的视觉表征上。未来的突破点在于,如何设计出一种全新的、从底层就为“行动”而生的视觉模型,这将是解锁更高级机器人能力的关键。
这项研究为具身智能领域敲响警钟,揭示了过往研究中被忽视的“视觉鸿沟”。它不仅提供了高效的SOTA方案,更指明了未来的核心突破方向。如何构建真正为行动而生的视觉模型,将是下一个关键问题。