多模态检索头首次被锁定:揭开大模型长文档内部检索真相

量子位·2026年09月08日 17:40
上百页文档里,AI是怎么找到关键证据的?

随着Office AI和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。

但能够接收一整份文档,不等于能够正确使用其中的信息。

面对上百页文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?

EMNLP 2026接收的论文新作“Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”,从模型内部研究了这一过程。

从“装得下”到“找得到”

长上下文视觉语言模型可以同时接收大量文字和图片,但最终答案通常只依赖其中很小的一部分信息。相关证据可能是一段文字,也可能藏在表格、图片或某个版面区域中。

研究团队关注的问题是:当证据已经出现在输入中时,模型内部是否存在一组注意力头,负责将问题指向相关的文本或视觉内容?

团队将识别出的这类注意力头称为多模态检索头(MMRetHeads)。

怎么识别多模态检索头?

QRHead启发,研究团队提出了MMRetHeads检测方法。

具体来说,该方法分析每个注意力头的question-to-evidence attention,也就是问题token指向标注证据区域的注意力。证据如果是文字,就对应文字token;证据如果位于图片中,则对应视觉token。指向证据的注意力越强,该注意力头的检索得分就越高。

研究覆盖Qwen3-VL、Gemma3等6个长上下文视觉语言模型,包括文本检索、图像检索、渲染文本检索和相同图像检索等任务,并测试8K、16K、32K、64K和128K上下文长度。

分析还发现,文本和图像检索会共享一部分注意力头,但不同上下文长度和证据形式也会调用不同的注意力头。

这些注意力头真的会影响模型回答吗?

注意力指向证据,只能说明两者存在关联。为了检验模型是否真正依赖这些头,研究团队屏蔽得高分的检索头,再与屏蔽相同数量随机注意力头的结果进行比较。

在文字和图片检索任务中,屏蔽检索头后,模型在不同上下文长度和证据位置下的表现显著下降;随机屏蔽造成的影响则小得多。

同样的差异也出现在更真实的长文档问答中:

  • MMLongBench-Doc:48.2→5.7
  • SlideVQA: 71.2→8.9

随机屏蔽后,两项任务仍分别保留32.252.6分。屏蔽检索头造成的下降明显更大,说明这些头不只是把注意力放在证据附近,也对模型访问证据具有因果作用。

在多模态推理任务中也能观察到类似结果。检索头被屏蔽后,模型有时会在图表仍然存在于输入中的情况下回答“信息不足”,也可能读取错误内容或生成不存在的依据。

从内部机制到文档检索

研究团队进一步把这些注意力头中的证据信号用于多模态文档检索。

给定一个问题,MMRetHeads会为候选页面或版面区域计算相关性分数,并据此对候选项进行排序。页面级检索寻找包含证据的整页,版面级检索则进一步定位页面中的文字块、表格、图片或图表。整个过程不需要额外训练检索器。

在MMDocIR上,Qwen3-VL-8B的页面级Recall@1达到64.7,较最强的已报告基线提高7.7个百分点;版面级Recall@1达到39.0,较最强的已报告基线提高6.3个百分点。

论文链接:https://arxiv.org/abs/2605.27243

本文来自微信公众号“量子位”,作者:MMRetHeads团队,36氪经授权发布。

+1
4

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

苹果折叠屏iPhone因严控质量,初期产能低,或库存不足。

42分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业