传统VLA模型在执行多步骤机器人任务时频繁出错,根源在于缺乏对‘下一步该做什么’的结构化理解。PALM通过引入可供性推理与连续进度感知,首次实现了对复杂操作过程的可解释、可调控建模,为长时程自主操作提供了新范式。
智能速览
现有VLA模型无法识别关键操作对象和子任务完成度,导致重复动作、跳步或提前终止
PALM构建结构化‘可供性’表示,精准预测待交互物体、接触部位、目标区域及运动轨迹
引入连续进度值作为内置‘任务进度条’,使机器人实时掌握当前所处阶段
采用扩散变换器联合生成动作序列与下一进度值,实现动作与状态协同优化
在LIBERO-LONG基准上成功率高达91.8%,CALVIN任务平均完成长度提升12.5%
精华内容
当机器人不再只是执行指令,而是能判断‘现在该碰哪个杯子’‘香蕉放得是否到位’‘整个铺桌布流程完成了73%’,任务执行才真正具备了人类式的连贯性与容错力。
问题本质
多数VLA模型将视觉-语言-动作映射视为端到端黑箱,忽略任务内在结构。实验表明,在清理桌面类任务中,约68%的失败源于无法区分‘当前应拾取纸巾而非笔筒’,另有23%因误判‘已放置盘子’而跳过后续擦拭步骤。这种结构性盲区导致动作策略缺乏因果锚点,难以泛化到未见过的物体排列组合。
可供性重构
PALM将‘可供性’定义为四维结构化张量:相关物体ID、接触部位热图(如杯柄中部)、空间目标区域(如盘子右上象限)、最优位移向量。在真实机械臂测试中,其可供性预测准确率达89.4%,较基线模型SOTA提升31.6个百分点;对遮挡场景下的关键部位定位误差控制在2.3cm内,满足精细操作需求。
进度可量化
不同于二元完成判定,PALM输出0–1连续进度值。在‘摆餐具’任务中,系统将‘取出刀叉→并排放置→调整间距→校准朝向’分解为4个子阶段,每个阶段内部再细分为0.1单位增量。实测显示,进度预测均方误差仅0.042,且当进度值达0.92时,后续动作失败率下降至3.7%,显著优于阈值型触发机制。
协同决策机制
扩散变换器以当前图像、可供性张量和进度值为联合输入,每步生成6维动作向量(xyz位移+欧拉角+夹爪开合)及下一进度值。在CALVIN基准中,该机制使平均单任务动作序列长度达47.3步,较此前最长序列提升2.1倍;同时任务中断率从18.5%降至5.2%,证明长程依赖建模能力实质性增强。
PALM没有停留在提升单步精度,而是重建了机器人理解任务的方式——把抽象目标拆解为可感知、可测量、可调控的中间状态。这不仅是技术路径的升级,更指向人机协作的新可能:当机器人能主动报告‘进度卡在第三步,因布料反光干扰识别’,故障诊断与人机协同效率将发生质变。未来,这类结构化认知能力会否成为通用具身智能的基础设施?