[CVPR 2025候选] SAIL:语义对齐与 LLM 增强,重塑弱监督视频定位新范式

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

总结
问题
方法
结果
要点
摘要

本文提出了 SAIL,一种针对弱监督密集视频字幕生成(WSDVC)的新型学习框架。通过引入“相似性感知引导”和基于 LLM 的“视觉间隙增强”策略,SAIL 在无需时间边界标注的情况下,实现了视频事件定位与文本描述的高度对齐。该方法在 ActivityNet 和 YouCook2 数据集上均刷新了 SOTA 纪录,其中 CIDEr 得分提升至 35.38。

TL;DR

在弱监督密集视频字幕生成(WSDVC)领域,如何在没有时间戳的情况下精确对齐“视频片段”与“文字描述”一直是长久以来的挑战。本文提出的 SAIL (Similarity-Aware Guidance & Inter-Caption Augmentation) 框架,通过引入跨模态语义相似性约束和 LLM 驱动的伪标签增强,成功解决了标注稀疏导致的定位模糊问题。实验结果显示,SAIL 在多个 SOTA 榜单上均取得领先,表现甚至媲美全监督方法。

痛点深挖:消失的语义与稀疏的标注

传统的 WSDVC 模型(如 ILCACM)通常采用一种“互补掩码”策略:模型预测一组高斯掩码,试图把视频切分成不重叠的块,并让这些块分别生成不同的 Caption。

然而,这种做法存在物理上的直觉缺陷:

  1. 缺乏语义锚点:模型只要保证两个掩码不重叠就能降低 Loss,而不关心这个掩码是否真的盖住了“正在切菜”的画面。这导致掩码宽度往往是均匀分布的,缺乏内容感知力。
  2. 标注真空期:一段 200 秒的视频可能只有 3 条标注。在第 1 条和第 2 条标注之间,可能发生了“拿起工具”等未记录动作。模型在这些“真空区域”得不到有效的学习信号,导致边界预测极其粗糙。

痛点对比图 左图显示了前人工作的均匀掩码,右图展现了 SAIL 基于语义对齐后的精准掩码。

核心算法解析:SAIL 的双重进化

1. 相似性感知引导 (Similarity-Aware Guidance)

SAIL 不再仅仅让模型盲目地预测高斯分布。作者引入了 CLIP 作为语义裁判。

  • 逻辑:计算被 Mask 覆盖的视觉特征向量()与对应标题特征向量()的余弦相似度。
  • Loss 设计:采用 Margin Ranking Loss,不仅要最大化正样本对的相似度,还要最小化同一视频内其他描述的干扰。这种设计迫使高斯掩码的中心点 和宽度 必须移动到与文本内容最匹配的视频区域。

2. LLM 驱动的间隙增强 (Inter-Caption Augmentation)

为了填补标注之间的“真空”,SAIL 请出了 LLM(如 Qwen3)。

  • 推理逻辑:给定相邻的 Caption A(“在厨房洗菜”)和 Caption B(“把菜放入热锅”),LLM 会推测出中间的过渡 Caption C(“擦干蔬菜并移动到炉灶旁”)。
  • 辅助监督:为这些合成的“中间标题”分配专门的 Inter-masks。通过 损失函数,模型被引导去捕捉这些细粒度的过渡,从而让原本模糊的事件边界(边界 A 的结束点和边界 B 的起始点)变得更加精确。

模型总架构图 SAIL 总体架构:包含主路径的相似性引导和 LLM 增强的辅助分支。

实验结果与深度观察

在 ActivityNet Captions 和 YouCook2 上的表现证明了 SAIL 的强悍:

  • 性能飞跃:在 ActivityNet 上,SAIL 的 CIDEr (35.38) 和 F1 (57.00) 均达到弱监督领域的最高水平。
  • 消融实验:实验数据(Table 4)显示,单纯加入相似性感知(Sim)能提升约 1.76 CIDEr,而加入 LLM 增强(Synth)则进一步增强了定位的鲁棒性。
  • 自适应宽度:更有趣的发现是,SAIL 生成的掩码标准差远高于基线模型。这意味着模型真正学会了根据动作的时长来调整“焦点”窗口的大小,而不是简单地平分视频。

实验结果对比 表格 1 展示了 SAIL 在 CIDEr 等核心指标上相对于基线及全监督方法的优势。

总结与启示

SAIL 的成功为我们提供了一个清晰的视角:弱监督不代表无监督。通过巧妙地利用 CLIP 的跨模态先验和 LLM 的逻辑推理常识,我们可以从“稀疏”的标注中挖掘出“稠密”的训练信号。

局限性:尽管 LLM 生成的标题很合理,但若视频实际内容与 LLM 的常识冲突(例如一个搞怪视频),则可能会引入噪声。未来如何结合自动化的视觉验证(Visual Fact-checking)来过滤合成标题,将是一个值得研究的方向。

发现相似论文

试试这些示例

  • 查找最近一年内利用大语言模型 (LLM) 为弱监督视频理解生成高质量合成伪标签的其他相关论文。
  • 在高斯掩码 (Gaussian Masking) 策略之外,有哪些其他可微分的视频时间窗口表示方法可以提升视频事件定位的精度?
  • 探究如何将 SAIL 中的跨模态相似性引导机制应用到零样本 (Zero-shot) 密集视频字幕生成任务中。
目录
[CVPR 2025候选] SAIL:语义对齐与 LLM 增强,重塑弱监督视频定位新范式
1. TL;DR
2. 痛点深挖:消失的语义与稀疏的标注
3. 核心算法解析:SAIL 的双重进化
3.1. 1. 相似性感知引导 (Similarity-Aware Guidance)
3.2. 2. LLM 驱动的间隙增强 (Inter-Caption Augmentation)
4. 实验结果与深度观察
5. 总结与启示