在具身智能领域,VLA模型广为人知,但一种名为VAM的新范式正显示出更大潜力。它并非简单地在VLA中加入视频,而是从根本上改变了机器人的决策逻辑:从被动响应观测,到主动优化观测,以更接近人类思考的方式解决不确定性问题。
智能速览
VAM的核心优势是先建模观测,再建模动作。
VLA在给定观测下决策,VAM则主动优化观测条件。
动作在VAM中不仅是执行工具,也是信息采集手段。
VAM通过视频预训练,天然融入物理动力学与时序依赖。
这种范式变革被认为是通往更高级闭环智能的关键一步。
精华内容
VAM与VLA的根本区别,不在于是否使用视频,而在于处理观测与动作的先后顺序。这个顺序的颠倒,可能预示着机器人决策逻辑的一次范式级变革。
传统VLA的局限
VLA模型虽能处理视觉信息,但其决策模式存在局限。它默认世界是静态的,观测是固定的,其核心任务是在给定观测下,直接输出最优动作。即便是处理多模态动作分布的VLA,也只是承认存在多个合理选项,却从未想过是否应该先改变观测本身以降低不确定性。这种模式更像是在信息不全的情况下进行本能反射,而非主动思考。
VAM的核心突破
VAM(Video Action Model)的架构带来了突破。它通常包含两个模块:视频骨干网络负责根据当前观测和语言条件,预测未来的视频帧;动作解码器则基于这些预测画面,生成机器人的具体控制指令。这种设计使得模型能够预判不同动作可能带来的环境变化,为主动探索提供了基础。
动作成为信息工具
VAM的真正潜力在于将动作从纯粹的执行工具,转变为信息采集的手段。当机器人面临观测模糊、存在遮挡或噪声时,它不必立即执行一个可能错误的动作。而是可以模拟多种试探行为,预测哪种动作能让未来的观测更清晰、不确定性更低。这就像人看不清物体会先换个角度,而不是盲目伸手。
决策范式的升级
这一改变是范式级别的。传统VLA是在不确定性中“硬选”最优解,而VAM则是通过动作先主动消除不确定性。一个是在被动接受的世界里做决策,一个是通过自身行动去塑造一个更利于决策的世界。只有当系统能通过动作来主动优化下一步的观测,才算是真正走进了更高级的闭环智能。
VAM模型通过先优化观测、再规划动作的思路,为机器人应对真实世界的复杂性提供了新路径。它让动作从单纯的执行,进化为探索和理解的工具,这或许是通向更通用、更智能系统的关键一步。未来的机器人,是否会因此更像一个真正的思考者?
关键评论
VAM可理解为WAM(World Action Model),本质是强调视频作为世界模型进行预测。
有观点认为VAM是主动感知,是POMDP(部分可观察马尔可夫决策过程)的一个实例,这与解决真实世界问题的通用性有关。
人脑更像是一个兼具世界模型能力的VLA,既能解码动作,也能预测动态世界变化。
不具备3D感知的模型在3D世界中做交互,或许缺乏理论支撑。