[CVPR 2025候选] SAIL:语义对齐与 LLM 增强,重塑弱监督视频定位新范式
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
本文提出了 SAIL,一种针对弱监督密集视频字幕生成(WSDVC)的新型学习框架。通过引入“相似性感知引导”和基于 LLM 的“视觉间隙增强”策略,SAIL 在无需时间边界标注的情况下,实现了视频事件定位与文本描述的高度对齐。该方法在 ActivityNet 和 YouCook2 数据集上均刷新了 SOTA 纪录,其中 CIDEr 得分提升至 35.38。
TL;DR
在弱监督密集视频字幕生成(WSDVC)领域,如何在没有时间戳的情况下精确对齐“视频片段”与“文字描述”一直是长久以来的挑战。本文提出的 SAIL (Similarity-Aware Guidance & Inter-Caption Augmentation) 框架,通过引入跨模态语义相似性约束和 LLM 驱动的伪标签增强,成功解决了标注稀疏导致的定位模糊问题。实验结果显示,SAIL 在多个 SOTA 榜单上均取得领先,表现甚至媲美全监督方法。
痛点深挖:消失的语义与稀疏的标注
传统的 WSDVC 模型(如 ILCACM)通常采用一种“互补掩码”策略:模型预测一组高斯掩码,试图把视频切分成不重叠的块,并让这些块分别生成不同的 Caption。
然而,这种做法存在物理上的直觉缺陷:
- 缺乏语义锚点:模型只要保证两个掩码不重叠就能降低 Loss,而不关心这个掩码是否真的盖住了“正在切菜”的画面。这导致掩码宽度往往是均匀分布的,缺乏内容感知力。
- 标注真空期:一段 200 秒的视频可能只有 3 条标注。在第 1 条和第 2 条标注之间,可能发生了“拿起工具”等未记录动作。模型在这些“真空区域”得不到有效的学习信号,导致边界预测极其粗糙。
左图显示了前人工作的均匀掩码,右图展现了 SAIL 基于语义对齐后的精准掩码。
核心算法解析:SAIL 的双重进化
1. 相似性感知引导 (Similarity-Aware Guidance)
SAIL 不再仅仅让模型盲目地预测高斯分布。作者引入了 CLIP 作为语义裁判。
- 逻辑:计算被 Mask 覆盖的视觉特征向量()与对应标题特征向量()的余弦相似度。
- Loss 设计:采用 Margin Ranking Loss,不仅要最大化正样本对的相似度,还要最小化同一视频内其他描述的干扰。这种设计迫使高斯掩码的中心点 和宽度 必须移动到与文本内容最匹配的视频区域。
2. LLM 驱动的间隙增强 (Inter-Caption Augmentation)
为了填补标注之间的“真空”,SAIL 请出了 LLM(如 Qwen3)。
- 推理逻辑:给定相邻的 Caption A(“在厨房洗菜”)和 Caption B(“把菜放入热锅”),LLM 会推测出中间的过渡 Caption C(“擦干蔬菜并移动到炉灶旁”)。
- 辅助监督:为这些合成的“中间标题”分配专门的 Inter-masks。通过 损失函数,模型被引导去捕捉这些细粒度的过渡,从而让原本模糊的事件边界(边界 A 的结束点和边界 B 的起始点)变得更加精确。
SAIL 总体架构:包含主路径的相似性引导和 LLM 增强的辅助分支。
实验结果与深度观察
在 ActivityNet Captions 和 YouCook2 上的表现证明了 SAIL 的强悍:
- 性能飞跃:在 ActivityNet 上,SAIL 的 CIDEr (35.38) 和 F1 (57.00) 均达到弱监督领域的最高水平。
- 消融实验:实验数据(Table 4)显示,单纯加入相似性感知(Sim)能提升约 1.76 CIDEr,而加入 LLM 增强(Synth)则进一步增强了定位的鲁棒性。
- 自适应宽度:更有趣的发现是,SAIL 生成的掩码标准差远高于基线模型。这意味着模型真正学会了根据动作的时长来调整“焦点”窗口的大小,而不是简单地平分视频。
表格 1 展示了 SAIL 在 CIDEr 等核心指标上相对于基线及全监督方法的优势。
总结与启示
SAIL 的成功为我们提供了一个清晰的视角:弱监督不代表无监督。通过巧妙地利用 CLIP 的跨模态先验和 LLM 的逻辑推理常识,我们可以从“稀疏”的标注中挖掘出“稠密”的训练信号。
局限性:尽管 LLM 生成的标题很合理,但若视频实际内容与 LLM 的常识冲突(例如一个搞怪视频),则可能会引入噪声。未来如何结合自动化的视觉验证(Visual Fact-checking)来过滤合成标题,将是一个值得研究的方向。
