AIF:让 VLM 学会“选择性忽视”,突破“视而不见”的感知瓶颈

Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

总结
问题
方法
结果
要点
摘要

本文提出了 Adaptive Information Flow (AIF),一种改进多模态大模型(VLM)感知能力的训练推理阶段(Test-time)优化方法。通过动态调节 Causal Mask 来阻断文本对无关视觉 Token 的注意力,显著提升了 LLaVA-1.5 和 Qwen2.5-VL 在 VQA 和视觉定位等任务中的精度。

TL;DR

多模态大模型(VLM)经常陷入一个怪圈:它们在注意力图中明明标出了物体,回答时却胡言乱语。本文提出的 Adaptive Information Flow (AIF) 揭示了核心原因——信息流失调。作者通过一种无需训练的方法,在推理时动态“关掉”那些无关视觉 Token 对文本的影响,让模型专注于真正重要的区域。实验表明,这种方法在几乎不增加算力的情况下,显著提升了 LLaVA 和 Qwen 等主流模型的感知精度。


1. 痛点:看得见,却“理解”错

最近的学术研究(如 BLINK)发现 VLM 有个尴尬的现状:“Seeing but not perceiving”。即使模型能准确地定位到物体(Grounding 成功),它也可能在问答中失败。

作者的 Insight:这是因为在解码阶段,文本 Token 的注意力被大量无关的背景视觉 Token “稀释”或“干扰”了。这种空间分散的注意力模式将噪声引入了推理路径,直接导致了幻觉。

注意力分布对比 图 1:(a) 标准 VLM 注意力过于分散;(c) AIF 调制后的信息流专注于核心区域。


2. 核心机理:Token Dynamics 与 熵

既然并非所有视觉 Token 都有贡献,那如何筛选?作者提出了 Token Dynamics(Token 动态) 的概念:

  1. 观察:在 LLM 的不同层中,对应重要物体的视觉 Token 会表现出独特的、稳定的激活模式;而背景区域的激活则呈现出极高的不确定性和随机性。
  2. 熵作为度量:利用信息熵(Entropy)来量化这种随机性。熵越高,意味着该 Token 越可能是干扰项(Irrelevant)。
  3. 动态遮蔽 (Adaptive Masking):计算出 Token 熵图后,系统会自动寻找一个最优阈值,在推理所需的 Causal Mask 中阻断文本 Token 到高熵视觉 Token 的路径。

AIF 算法流程图 图 2:AIF 整体架构,从 Token Dynamics 到最终的 Causal Mask 生成。

与传统的 Token Pruning(剪枝) 不同,AIF 并不物理删除 Token,而是通过 Mask 调节信息流。这意味着视觉 Token 之间仍然可以相互通信(保持图像上下文完整),只是不让坏 Token 误导文本。


3. 实验战绩:全线飘红

作者在 LLaVA-1.5 和最新的 Qwen2.5-VL 上进行了广泛测试,结果令人印象深刻:

  • 泛化问答 (VQA):在 MMStar 榜单上,Qwen2.5-VL-7B 的表现提升了 7.0%。
  • 视觉定位 (Grounding):在 RefCOCO 系列任务上,即使不加专门的 Head,定位精度也提升了 2.3%,甚至超过了专门的检测模型 Grounding-DINO。
  • 解决幻觉问题:在 POPE 数据集上,LLaVA-1.5 的准确率从 85.4% 提升至 88.7%。

实验结果对比 表 1:在各个主流基准测试上的性能提升。


4. 深度洞察:为什么 Mask 比 Pruning 更强?

消融实验(Ablation Study)给出了几个有趣的结论:

  • 熵优于注意力值:简单地选择高注意力 Token(High-Attention tokens)效果并不好,因为许多噪声 Token 也会有瞬间的高激活。而基于熵的 Low-Entropy 选择法捕获重要物体的召回率(Recall)提升了 10%-20%。
  • 推理成本极低:虽然增加了一个前置的 Decoding 步骤,但总耗时仅相当于多生成 1 个 Token,这在处理长文本回答时几乎可以忽略不计。

可视化结果 图 3:可以看到被红色标记的 Masked tokens 大多是墙壁、背景等无关区域。


5. 总结与反思

AIF (Adaptive Information Flow) 为我们提供了一个全新的视角:模型性能不仅仅取决于它学到了什么(Weights),还取决于我们在推理时允许信息如何流动(Connectivity)。

局限性:作者也坦诚指出,如果用户提示词(Prompt)过于间接或冗长,模型可能很难在第一步准确捕获哪些是“重要”区域。此外,该方法目前主要针对单步注意力统计,如何结合更复杂的多轮对话动态仍有待探索。

总结:对于希望在不重训模型的情况下压榨 VLM 感知极限的开发者来说,AIF 这种通过简单修改 Mask 矩阵就能起效的方法,无疑具有极高的实战价值。

发现相似论文

试试这些示例

  • 查找其他最近试图通过推理侧(Test-time)优化或动态注意力策略来缓解多模态模型幻觉的论文。
  • 哪篇论文最早探讨了 Transformer 中视觉 Token 的冗余性(Token Pruning/Merging),本文的 Masking 策略与其有何本质区别?
  • 有哪些研究将类似 Causal Mask 调制的机制应用到了视频理解或多模态长文本生成任务中?
目录
AIF:让 VLM 学会“选择性忽视”,突破“视而不见”的感知瓶颈
1. TL;DR
2. 1. 痛点:看得见,却“理解”错
3. 2. 核心机理:Token Dynamics 与 熵
4. 3. 实验战绩:全线飘红
5. 4. 深度洞察:为什么 Mask 比 Pruning 更强?
6. 5. 总结与反思