DeepScan:突破 LVLM 视觉陷阱,自下而上重筑“证据级”推理

DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

总结
问题
方法
结果
要点
摘要

本文提出了 DeepScan,一个无需训练(training-free)的通用框架,旨在提升多模态大模型(LVLM)在复杂视觉任务中的 grounding 与推理能力。该方法通过模拟人类“自下而上”的扫描习惯,在 V* 基准测试上配合 Qwen2.5-VL-7B 达成了 90.6% 的 SOTA 准确率。

在处理复杂的视觉推理任务时,人类的直觉往往是“局部扫描 -> 确认细节 -> 关联上下文”。然而,当前顶尖的多模态大模型(LVLM)在面对一张 8K 超清大图中的微小目标时,更倾向于一种“全局速览”的俯冲式策略。这种策略在遭遇嘈杂背景或语义干扰时,极易陷入 Attention Sink/Drift 的陷阱,导致模型“睁眼说瞎话”。

日前,来自华东师范大学等机构的研究团队提出了 DeepScan。这是一个无需微调(Training-free)的即插即用框架,它不仅在 V* 等严苛的视觉基准测试中刷写了 SOTA 记录,更从认知科学的角度,为 LVLM 引入了一套高效的“分层扫描”逻辑。

1. 核心痛点:为什么 LLM 会在视觉证据面前“失明”?

现有的 visually grounded reasoning 方法(如 Dyfo 或 ZoomRefine)大多遵循“中心化”的搜索逻辑:先看全图,再逐渐放大。这种方法的局限性在于:

  • 噪声敏感:在大图中,关键证据(可能只占 0.05% 的面积)会被海量的背景信息淹没。
  • 定位失效:当存在多个相似物体时,Top-down 策略容易产生注意力漂移,定位到错误的代理(Proxy)上。

框架总览图

2. 核心机制:自下而上的“分层扫描”

DeepScan 的精髓在于其 Hierarchical Scanning 模块,它将“大海捞针”变成了“分块收网”。

Step 1: 局部线索探索 (Local Cue Exploration)

系统将图像划分为多个 Patch(如 576x576),并在各 Patch 内利用 Search Expert(如 BLIP-ITM)提取注意力图。通过 Otsu's Method 自动阈值处理,将注意力热力转化为离散的候选线索点。

Step 2: 多尺度证据提取 (Multi-scale Evidence Extraction)

利用点提示(Point Prompt)驱动 Visual Expert(如 LangSAM)进行分割。为了解决单点提示容易导致的空洞或上下文缺失问题,DeepScan 引入了 形态学后处理(膨胀与闭运算)。这种“自下而上”的恢复方式,能比传统的 Box 探测更精准地捕获不规则证据。

Step 3: 重聚焦与协作 (Refocusing)

找到了证据,但推理仍需上下文。Refocusing 模块模拟了相机的变焦过程:通过 Zoom-In(缩小范围增强属性感知)和 Zoom-Out(扩大范围增强空间关系感知)的搜索空间设计,利用 LVLM 作为“指挥官”评估哪个视角最有助于回答问题。

3. 实验战绩:低成本下的性能飞跃

在对比实验中,DeepScan 展示了极强的通用性与优越性。

  • SOTA 刷榜:在 V* Benchmark 上,配合 Qwen2.5-VL-7B,DeepScan 达成了 90.6% 的准确率,甚至超越了由于 RL 训练而高度优化的 DeepEyes 11500 模型。
  • 跨模型泛化:无论是 7B 的小参数模型,还是 72B 的重量级模型,DeepScan 均能在无需重训的情况下提供显著的增益。

实验结果对比

4. 深度洞察:计算换精度 (System 2 for Vision)

DeepScan 实际上揭示了视觉推理领域的一个重要趋势——推理时计算(Inference-time Computation) 的价值。

  1. SNR 放大效应:通过 Patch 化处理,系统显著提升了局部信噪比。实验证明,即使只处理 Top-10 最小面积的候选区域,也能保留 96% 以上的最优性能。
  2. 工程与算法的平衡:研究者通过 Batching 优化,克服了传统 Agent 模式串行判定的低效问题。将 13s 的延迟压缩至 3s 左右,这使得“扫描-重聚焦-推理”的链路在实际场景中具备了落地可能。

5. 局限性与展望

尽管 DeepScan 表现卓越,但在处理跨度极大的多个证据时(如位于对角线的两个微小物体),目前采用的“最小外接矩形”融合方式可能会引入多余的背景噪声。

未来,如何将这些离散的证据片段进行“生成式布局提取”(Generative Composition),从而在保留属性信息的同时摒弃背景冗余,将是该领域下一个值得关注的突破口。


总结:DeepScan 成功证明了,相比于盲目追求更大的视觉编码器或更长的 Context Window,一套符合人类认知逻辑的、精密的感知算法更能让 LVLM 在视觉细节的迷雾中看清真相。

发现相似论文

试试这些示例

  • 查找最近其他采用 Test-time Scaling 策略(如计算分摊或多次采样)来增强多模态模型推理能力的论文。
  • DeepScan 中的 Hierarchical Scanning 如何与 SAM (Segment Anything Model) 或 GroundingDINO 等视觉专家模型进行深度解耦或替换?
  • 有哪些研究探讨了在机器人操作(Embodied AI)任务中应用类似的“自下而上”视觉扫描机制来处理遮挡问题?
目录
DeepScan:突破 LVLM 视觉陷阱,自下而上重筑“证据级”推理
1. 1. 核心痛点:为什么 LLM 会在视觉证据面前“失明”?
2. 2. 核心机制:自下而上的“分层扫描”
2.1. Step 1: 局部线索探索 (Local Cue Exploration)
2.2. Step 2: 多尺度证据提取 (Multi-scale Evidence Extraction)
2.3. Step 3: 重聚焦与协作 (Refocusing)
3. 3. 实验战绩:低成本下的性能飞跃
4. 4. 深度洞察:计算换精度 (System 2 for Vision)
5. 5. 局限性与展望