多模态大语言模型(MLLM)的决策过程常如黑箱,一个名为 EAGLE 的归因框架为此带来突破。它能精准定位模型生成文本时关注的图像区域,并量化其对视觉信息与语言先验的依赖程度,为理解、诊断和改进模型提供了全新视角,相关论文已被 CVPR 2026 接收。
智能速览
EAGLE是一个面向MLLM的通用归因框架,用于解释自回归词元生成过程。
该框架能回答模型“关注哪里”和“依赖什么”两个核心问题。
EAGLE是模型无关的,且仅需前向传播,计算高效、无需梯度。
在多个基准测试中,其归因质量与忠实度显著优于现有先进方法。
该框架可用于定位幻觉来源,并揭示模型的语义脆弱性。
研究已扩展至推理模型和视频模型,显示出良好的泛化能力。
精华内容
EAGLE 框架通过回答两个核心问题,为揭开多模态模型的神秘面纱提供了系统性工具。其核心优势在于精准性与普适性。
两大核心问题
EAGLE 框架旨在解决 MLLM 可解释性的两个关键挑战。“Where MLLMs Attend?” 目标是将模型生成的每一个输出 token,都精确地归因到输入图像的具体区域。这就像给模型的“目光”装上追踪器,让用户能直观地看到,在生成描述某个物体时,模型究竟“看”了图像的哪个部分。
“What They Rely On?” 则更进一步,它尝试量化区分每个输出 token 的生成,在多大程度上依赖于视觉证据,又在多大程度上是受语言先验知识驱动。这揭示了模型推理的内在驱动力来源,判断其决策是基于“所见”还是“所知”。
高效且通用
EAGLE 框架的一大优势是 model-agnostic,意味着它既能解释如 GPT-5.2 这类闭源的 API 模型,也能应用于任意开源的多模态大模型,适用范围极广。
在计算效率上,EAGLE 仅需一次前向传播即可完成归因分析,无需复杂的梯度计算或高昂的显存开销,实用性很强。
在 Image Caption 与 VQA 等多个主流基准测试上,EAGLE 在归因质量和忠实度方面,其表现显著优于 LLaVACAM(NAACL 2025 Oral)和 TAM(ICCV 2025 Oral)等已有的先进方法。
深层应用探索
该框架的应用不止于基础归因。在幻觉归因方面,EAGLE 能够精确定位导致物体幻觉产生的图像关键区域,并通过 mask 等方式验证其因果影响,为诊断和修正模型错误提供了有力工具。
此外,研究者还进行了语义最小扰动分析,通过在语义层面施加最小干预,促使模型从正确输出转为错误输出。这种分析能揭示模型在语义理解上的脆弱性,以及可能存在的 shortcut 依赖问题,从而帮助开发者构建更稳健的模型。
EAGLE 框架为多模态大模型的可解释性研究提供了坚实的新工具,其开源属性也将推动社区的共同进步。未来,能否基于此类工具构建更可靠、更少幻觉的 AI 模型,值得期待。