屏蔽几个"检索头",多模态模型就读不懂财报了:EMNLP 2026 这篇论文,第一次揭开长文档找证据失败的内幕

源自10位全网作者

03:52

多模态大模型读长文档,最吓人的翻车不是"读不完",而是:证据明明就在上下文里,它偏说没有。

你塞进 128 页财报,问一句"今年研发资本化率是多少",它淡定回复"信息不足";同一张报表截图单独发给它,它可能三秒钟就给出正确数字。很多人把这归咎于玄学、手气或者 Prompt 没写好。9 月 8 日,量子位报道了一篇 EMNLP 2026 接收的论文,把这类失败的锅,第一次甩到了一个具体、可数、可屏蔽的部件上——模型内部的"多模态检索头"。36氪

第一次被"点名"的部件

论文题为 Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models(arXiv:2605.27243)。36氪 方法直接:检查每个注意力头从问题 token 指向标注证据位置的注意力强度——证据在文字里就对应文字 token,证据在图表、版面里就对应视觉 token,得分最高的那批头被命名为 MMRetHeads。

这个思路受此前纯文本模型检索头研究 QRHead 的启发,而这篇论文第一次把"检索头"从文本扩展到图像、渲染文本和版面区域,覆盖 Qwen3-VL、Gemma3 等 6 个长上下文视觉语言模型,在 8K 到 128K 五档上下文长度上测试。量子位

屏蔽几个

结论里有个容易被忽略的细节:文本检索和图像检索会共享一部分注意力头,但并不完全重合,不同上下文长度、不同证据形式,调用的头还不一样。36氪 也就是说,“在文档里找字"和"在文档里找图”,在模型内部是部分独立的通道——找字找得准,不代表看得见图。

真正扎眼的是消融实验

注意力指向证据,只能说明相关。团队做了因果检验:把得分最高的检索头屏蔽掉,再和屏蔽同样数量随机头做对照。

  • 长文档问答 MMLongBench-Doc:48.2 → 5.7;

  • 幻灯片问答 SlideVQA:71.2 → 8.9;

  • 随机屏蔽对照组:两项任务仍分别保留 32.2 分和 52.6 分。

随机砍一批头,模型几乎不疼不痒;精准砍掉检索头,直接接近瘫痪。换句话说,多模态模型内部"找证据"这个动作,是靠少数没有备份的头扛着的——它们一掉线,就是断崖式失败。量子位

屏蔽几个

失败形态也更值得对号入座:检索头被屏蔽后,模型会在图表明明就在输入里的情况下回答"信息不足",也会读错内容,甚至凭空编造不存在的依据。36氪 这三种症状,恰好对上了社区里攒了几年的体验式吐槽——知乎上"AI 处理长文本为什么容易出错"的问题下面一堆"迷失在中间"的实测。知乎 小红书上法律从业者也在发帖问合同能不能直接丢给 AI。小红书 现在这些吐槽第一次有了部件级的归因:不是它"不想看",是"负责找证据的那条线"断了。

另一面:免费的检索器,但别指望太多

作者还把这批头反向用起来:不训练任何额外检索器,直接用检索头的注意力给候选页面和版面区域打相关性分数排序。在 MMDocIR 基准上,Qwen3-VL-8B 页面级 Recall@1 达到 64.7,比最强已报告基线高 7.7 个百分点;版面级 Recall@1 达到 39.0,高 6.3 个百分点。量子位

屏蔽几个

这组数字要泼两盆冷水:一方面,免训练、复用一次前向传播,意味着每个长上下文多模态模型内部都藏着一个现成的重排器,这是真机会;另一方面,64.7 也意味着大约每 3 个页面就有 1 个找不到证据,版面级 39 分只能算勉强可用——而且这是 8B 开源模型的成绩,不是商用 API 的能力,目前也没有任何一家把注意力头数据开放给调用方。研究给的是路线,不是现成产品。

对拿多模态模型啃文档的人,意味着三件事

如果你在用多模态大模型处理财报、合同、研报这类百页级图文材料,这篇论文改写了三个默认假设:

  1. “装得下"不等于"找得到”。 上下文窗口是仓库,检索头是叉车;仓库可以越建越大,叉车数量却是固定的少数几台,还经常不备份。堆 128K token 不提升找证据的成功率。

  2. 翻车是通道问题,所以显得随机。 同一份文档同一个问题,一次答对一次装瞎,不是错觉。现阶段最便宜的补丁是让模型输出证据位置(页码、表编号)再抽查复核,而不是反复改 Prompt。

  3. 可靠性不要全押在"模型自己会找"。 法律、财务审核这类高风险场景,切块+外部检索+模型只读筛选页,仍然是主架构。检索头研究对从业者真正的价值,是给出了明确的改进坐标:以后哪款模型在评测里把"证据定位"当显式指标、哪家的可解释性工具能暴露注意力检索信号,才是长文档能力真正上台阶的信号。

普通用户只需要记住一件事:下次多模态模型在证据面前说"信息不足",别怀疑人生,先把那张图单独拎出来重问一遍——能答对,是检索失败;还答错,才是能力不够。这两件事过去一直被混在同一张定价页和同一份跑分表里,现在,它们之间终于有了一层可解剖的结构。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章