多模态大模型在视觉问答任务中常因无法精准聚焦而失败。香港科技大学提出的GoG框架,通过引入主动视觉规划,教会模型在全局浏览与局部精查间智能切换,显著提升了其在知识密集型问题上的搜索效率与答案可靠性。
智能速览
GoG框架解决了多模态模型在视觉问答中“看得多但不会聚焦”的核心痛点。
模型通过主动视觉规划,在全局浏览与局部精查间自适应切换。
Selective Gaze机制能精准评估信息价值,只对关键区域进行搜索。
双阶段训练框架结合了行为对齐与强化学习,提升模型搜索与反思能力。
实验证明,GoG显著提升了关键区域命中率与错误后的自我纠正能力。
精华内容
这项名为Glance-or-Gaze的框架究竟如何实现主动视觉规划?其背后的机制与训练方法揭示了AI视觉推理的下一个进化方向。
模型为何会“看错”
当前多模态模型在视觉理解上能力不俗,但面对知识密集型视觉问答(如识别长尾实体或最新事件)时却频繁出错。其核心问题并非模型“看不见”,恰恰相反,是看得太多、太杂,缺乏主动聚焦关键信息的能力。模型会对整张图像进行无差别处理,导致大量视觉噪声干扰了最终判断,无法高效定位到与问题最相关的视觉证据。
GoG:从全局到局部
GoG框架的核心是引入“主动视觉规划”,让模型从被动的全图感知转向主动的、策略性的视觉搜索。框架包含两种模式:Glance(全局浏览)和Gaze(局部精查)。模型会先判断问题的复杂度,决定是快速扫描整个图像,还是聚焦于某个关键区域进行深入分析。
其中,Selective Gaze机制是关键。面对多个候选裁剪区域时,模型会主动评估每个区域的“信息价值”,预测其包含答案的概率,并仅选择最有可能的区域执行详细的视觉和语言推理,从而大幅减少无关信息的干扰。
双阶段训练策略
为了让模型学会这种高级的视觉规划能力,研究者设计了双阶段训练框架。第一阶段是Reflective GoG Behavior Alignment(SFT),通过人工验证过的搜索轨迹数据,采用监督学习的方式,教会模型基础的行为模式,即“什么时候该搜、该搜哪里”。
第二阶段则是Complexity-Adaptive Reinforcement Learning(RL)。研究者将问题按难度分层,利用那些失败率高、难度大的样本来进行强化学习策略优化。这种训练方式促使模型在不确定的复杂场景下更积极地探索、进行多步搜索,并在犯错后学会自我纠正。
可量化的性能飞跃
经过双阶段训练后,GoG框架在关键性能指标上取得了显著提升。实验数据显示,模型对关键区域的命中率最高提升了约6.8%。更重要的是,模型的高级认知能力得到增强,当首次搜索失败后,主动进行反思并重新选择区域进行探索的概率,从原来的30%大幅提升至70%。这证明了GoG不仅提升了感知精度,更强化了模型的推理与决策能力。
GoG框架的提出,标志着多模态模型向主动智能迈出关键一步。这种学会思考“该看哪”的能力,不仅提升了模型的知识推理上限,也为未来更强大的AI Agent系统提供了核心思路。主动规划的AI,下一步将走向何方?