当前机器人模型多在失败后才补救,效率低下。CycleVLA提出主动式自我纠错新范式,在任务关键节点预判风险并回退重试,显著提升了长序列任务的成功率,为机器人学习提供了新思路。
智能速览
CycleVLA 让模型能感知自身在任务中的进度,为预判失败提供时间窗口。
通过结合外部VLM模型,在子任务接近完成时主动预测失败风险。
它采用子任务级精准回退,而非简单重启整个任务,大幅降低纠错成本。
引入MBR解码策略,在重试时选择最具共识的动作方案,提升一次成功率。
该技术对训练不足的中小模型尤其有效,能使其表现逼近大型模型。
精华内容
CycleVLA的核心突破在于将“被动补救”转变为“主动预判”。它通过一系列精巧的设计,让机器人拥有了预见并规避风险的能力,下面深入其技术实现细节。
进度感知是基础
传统VLA模型缺乏对任务进度的认知,导致无法预判未来。CycleVLA的创新起点,便是在原有的7维动作空间基础上,额外增加了对「停止信号」和「子任务进度」的预测。这使得模型不再是盲目执行,而是能明确知道自己当前做到了哪一步,是否接近完成。
这种自我认知能力的建立,为后续进行失败风险预测提供了至关重要的时间窗口,是实现主动纠错的第一步。
VLM预测与回退
当CycleVLA感知到子任务进度接近完成(例如达到90%)时,便会启动其核心的失败预测机制。此时,系统会引入一个外部的视觉语言模型(VLM)作为“裁判”。
这个VLM会综合分析机器人腕部摄像头和第三人称视角的实时画面,判断当前操作是否存在失败风险,如物体位置是否偏移、抓取姿态是否不稳。基于判断结果,系统将做出关键决策:是继续执行,还是立即回退到更早的子任务以恢复前置条件。
精准回退降成本
CycleVLA的回退策略极具效率。它并非简单粗暴地从头再来,而是执行子任务级别的精准回退。当预测到即将失败时,模型会自动定位到“最早能修复当前问题”的那个子任务。
例如,如果是抓取后的放置环节可能出错,系统不会回到最开始,而是选择回退到“重新抓取”或“重新对齐”这一步。这种精准操作避免了大量无效的重复执行,显著降低了长时序任务中的纠错时间与能量成本。
MBR解码提效率
回退之后如何确保一次重试成功?CycleVLA采用了名为Minimum Bayes Risk(MBR)的解码策略。在决定回退并重试时,VLA模型不会只生成一个动作方案,而是随机采样出多个可能的动作轨迹。
MBR解码器的作用,就是从这些备选方案中,评估并选择那个“最具共识”的高密度动作路径,即最有可能成功的方案。这一过程无需额外训练,是一种纯粹的测试时计算扩展技术,有效提高了重试的成功率。
CycleVLA通过进度感知、主动预测、精准回退与MBR解码的组合,为机器人纠错提供了一套高效且低成本的解决方案。它不仅提升了现有模型的性能上限,也为“欠训练”的中小模型开辟了新的可能性,这会是具身智能领域的新方向吗?