视觉语言模型能否像人一样,通过一个快照判断任务进展到了哪一步?针对这一挑战,西北大学的研究提出了系统性解决方案,不仅构建了评估基准PROGRESS-BENCH,还开发了专用模型PROGRESSLM,为提升AI的推理能力开辟了新方向。
智能速览
研究提出PROGRESS-BENCH基准,用于评估视觉语言模型的任务进展推理能力。
大多数现有VLM在任务进展估计上表现有限,对视角变化敏感。
训练前提示方法效果有限,且可能对小模型造成性能下降。
训练后的PROGRESSLM-3B模型在小规模下实现了显著且鲁棒的进展估计改进。
精华内容
为了让AI能像人一样判断任务做到哪一步了,研究者们探索了一条新路径,从提出评测标准到打造专用模型,整个过程充满了挑战与突破。
评估新基准
为了系统性地衡量视觉语言模型的进展推理能力,研究者构建了PROGRESS-BENCH评测基准。该基准包含超过3000个任务进展估计实例,精心控制了演示模式(视频关键帧序列或文本动作描述)、观察视角以及问题的可回答性这三个关键变量。
在标注方法上,研究者从任务演示中抽取中间帧作为观察样本,并通过线性插值的方式为其标注精确的进展百分比,为模型训练和评估提供了高质量的数据支持。
通用模型困境
在PROGRESS-BENCH上的实验结果表明,当前主流的视觉语言模型在任务进展估计这一任务上普遍表现不佳。这些模型不仅估计精度有限,还对演示的模式和观察的视角变化极为敏感,难以适应多样化的输入场景。
此外,当面对信息不足、无法判断进展的场景时,大多数模型也未能给出合理的“无法回答”反馈,暴露了其在复杂推理情境下的脆弱性。
两条改进路径
研究者探索了两种提升模型进展推理能力的方法。第一种是训练前提示,通过设计特定的提示词,鼓励模型模拟人类的“场景回忆”和“心理模拟”两阶段推理过程。然而,这种方法的效果非常有限,且与模型规模强相关,对大型模型略有提升,却常导致小型模型性能下降,缺乏普适性。
PROGRESSLM的突破
第二种方法是进行专门的训练后学习,由此诞生了PROGRESSLM-3B模型。实验证明,这条路径取得了显著成功。即便是在30亿参数的小模型规模上,PROGRESSLM也实现了进展估计能力的巨大飞跃。
更关键的是,该模型表现出强大的稳定性和鲁棒性,即使面对跨视角的观察样本或纯文本的任务演示,它依然能够有效且准确地估计任务进展,展现了显式训练在解决复杂推理问题上的巨大优势。
这项研究不仅揭示了视觉语言模型在进展推理上的核心难点,更通过PROGRESS-BENCH和PROGRESSLM提供了评测工具与解决范例。它证明了显式训练能有效提升AI的深层认知能力,为未来打造更懂任务进程的智能体奠定了基础。这种能力将如何赋能机器人、自动化教学等领域,值得期待。