张大妈

上海大学联合南开大学揭示多模态模型中一个被忽视的重要偏置问题

源自今日头条:机器之心Pro

02-05 13:55

视觉语言模型(VLM)的推理效率是应用落地的一大挑战,主流的视觉剪枝技术依赖Attention机制判断信息重要性。然而,这项研究揭示,Attention本身存在位置偏置等系统性问题,会误导剪枝决策。研究团队提出了一种无需重新训练的去偏方法,有效提升了多种剪枝策略的稳定性与准确性,为高效可靠地部署多模态模型提供了新的技术路径。

上海大学联合南开大学揭示多模态模型中一个被忽视的重要偏置问题智能速览

  • 视觉语言模型推理成本高,视觉剪枝是提升效率的关键技术。

  • 研究揭示,用于剪枝的Attention机制存在系统性偏置,并非语义重要性的可靠指标。

  • 主要偏置包括位置偏置(关注后方token)和padding区域引发的attention sink现象。

  • 提出一种无需重新训练的Attention去偏方法,可作为即插即用模块。

  • 该方法在多种主流剪枝策略和十多个基准测试上,均能带来稳定性能提升。

上海大学联合南开大学揭示多模态模型中一个被忽视的重要偏置问题精华内容

Attention机制常被视为模型“关注点”的直接体现,但这项研究挑战了这一直觉。在视觉语言模型中,Attention背后隐藏着与内容无关的结构性偏置,这些偏置如何影响模型效率优化?

剪枝的隐形陷阱

在视觉语言模型中,基于Attention的剪枝策略普遍存在一个被忽视的陷阱。Attention机制虽然直观上反映了模型关注的区域,但其计算结果受到结构性偏置的严重影响。首先是位置偏置,模型会给予序列中位置靠后的视觉token更高的权重,这导致剪枝时倾向于保留图像下方的区域,即使这些区域语义信息不重要。其次是padding偏置,为了统一输入尺寸而填充的空白区域,其对应的token反而可能因异常激活获得高Attention,被错误保留。这些偏置在剪枝过程中会被放大,导致结果偏离真实需求。

无需重训的去偏法

针对Attention偏置问题,研究团队并未设计全新的剪枝算法,而是从根源出发,提出了一种Attention Debiasing方法。该方法的核心思想是,既然Attention中的偏置呈现稳定趋势,就可以先对其进行修正。具体而言,通过拟合Attention随token位置变化的曲线,构建出位置偏置的模型,并据此对原始Attention进行去偏校正,削弱与内容无关的位置因素。同时,在剪枝时显式抑制padding token的影响。整个过程无需重新训练模型,也不依赖特定剪枝策略,可作为一个即插即用的模块使用。

广泛验证的有效性

为验证该去偏方法的普适性与有效性,研究团队在多个主流模型和任务上进行了系统测试。该方法被集成到FastV、PyramidDrop等6种主流剪枝方法中,并在10个图像理解基准和3个视频理解基准上进行了评估,覆盖了LLaVA-7B/13B等多种模型。实验结果显示,在几乎所有设置下,引入Attention去偏后,剪枝模型的性能都获得了一致且稳定的提升,尤其在剪枝更激进、token预算更紧张时,效果更为显著。可视化分析也表明,去偏后的剪枝能更精准地聚焦于语义相关的目标物体。

重新审视Attention

这项研究的核心贡献在于,它挑战了“Attention天然等价于语义重要性”的固有认知,并揭示了其在多模态模型中存在的结构性缺陷。通过提出简单高效的去偏方案,该研究不仅解决了视觉剪枝中的一个具体痛点,更重要的是为审视和优化AI模型提供了新视角:在追求更高效率时,必须关注基础组件的潜在偏置。这一发现有助于推动更高效、更可靠的多模态模型部署。

这项研究深刻揭示了Attention机制在VLMs中的局限性,为模型高效优化提供了至关重要的修正方向。通过简单的去偏操作,无需额外训练成本即可提升模型剪枝的可靠性。这不禁引人思考,在AI模型优化的其他领域,是否也潜藏着类似被忽视的基础性问题,等待我们去发现和解决?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章