张大妈

🤖具身|为什么VAM 比 VLA 更有前途

源自小红薯:具身薯风啸

03-02 15:13

在具身智能领域,VLA模型广为人知,但一种名为VAM的新范式正显示出更大潜力。它并非简单地在VLA中加入视频,而是从根本上改变了机器人的决策逻辑:从被动响应观测,到主动优化观测,以更接近人类思考的方式解决不确定性问题。

🤖具身|为什么VAM 比 VLA 更有前途智能速览

  • VAM的核心优势是先建模观测,再建模动作。

  • VLA在给定观测下决策,VAM则主动优化观测条件。

  • 动作在VAM中不仅是执行工具,也是信息采集手段。

  • VAM通过视频预训练,天然融入物理动力学与时序依赖。

  • 这种范式变革被认为是通往更高级闭环智能的关键一步。

🤖具身|为什么VAM 比 VLA 更有前途精华内容

VAM与VLA的根本区别,不在于是否使用视频,而在于处理观测与动作的先后顺序。这个顺序的颠倒,可能预示着机器人决策逻辑的一次范式级变革。

传统VLA的局限

VLA模型虽能处理视觉信息,但其决策模式存在局限。它默认世界是静态的,观测是固定的,其核心任务是在给定观测下,直接输出最优动作。即便是处理多模态动作分布的VLA,也只是承认存在多个合理选项,却从未想过是否应该先改变观测本身以降低不确定性。这种模式更像是在信息不全的情况下进行本能反射,而非主动思考。

VAM的核心突破

VAM(Video Action Model)的架构带来了突破。它通常包含两个模块:视频骨干网络负责根据当前观测和语言条件,预测未来的视频帧;动作解码器则基于这些预测画面,生成机器人的具体控制指令。这种设计使得模型能够预判不同动作可能带来的环境变化,为主动探索提供了基础。

动作成为信息工具

VAM的真正潜力在于将动作从纯粹的执行工具,转变为信息采集的手段。当机器人面临观测模糊、存在遮挡或噪声时,它不必立即执行一个可能错误的动作。而是可以模拟多种试探行为,预测哪种动作能让未来的观测更清晰、不确定性更低。这就像人看不清物体会先换个角度,而不是盲目伸手。

决策范式的升级

这一改变是范式级别的。传统VLA是在不确定性中“硬选”最优解,而VAM则是通过动作先主动消除不确定性。一个是在被动接受的世界里做决策,一个是通过自身行动去塑造一个更利于决策的世界。只有当系统能通过动作来主动优化下一步的观测,才算是真正走进了更高级的闭环智能。

VAM模型通过先优化观测、再规划动作的思路,为机器人应对真实世界的复杂性提供了新路径。它让动作从单纯的执行,进化为探索和理解的工具,这或许是通向更通用、更智能系统的关键一步。未来的机器人,是否会因此更像一个真正的思考者?

🤖具身|为什么VAM 比 VLA 更有前途关键评论

  • VAM可理解为WAM(World Action Model),本质是强调视频作为世界模型进行预测。

  • 有观点认为VAM是主动感知,是POMDP(部分可观察马尔可夫决策过程)的一个实例,这与解决真实世界问题的通用性有关。

  • 人脑更像是一个兼具世界模型能力的VLA,既能解码动作,也能预测动态世界变化。

  • 不具备3D感知的模型在3D世界中做交互,或许缺乏理论支撑。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐