[CVPR 2025] CalibAtt:视频生成的无痛加速,推理效率提升 58%

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

总结
问题
方法
结果
要点
摘要

本文提出了 CalibAtt,一种针对视频生成扩散模型的高效、无需训练(training-free)的稀疏注意力加速方法。通过离线校准提取数据无关的块级稀疏与重复模式,在 Wan 2.1 和 Mochi 1 等模型上实现了高达 1.58x 的端到端推理加速。

TL;DR

在视频生成领域,Transformer 架构虽强,但其二次方增长的计算复杂度(Attention Bottleneck)一直是规模化部署的死穴。苹果公司与特拉维夫大学联合推出的 CalibAtt 提出了一种创新的“离线校准(Offline Calibration)”策略。它通过极少量的样本学习模型固有的稀疏模式,无需任何训练即可在 Wan 2.1 等 SOTA 模型上实现 1.58x 的加速,且几乎不损失视频质量。

痛点深挖:计算都在做“无用功”?

现有的大规模视频扩散模型(如 Wan 2.1, Sora-like models)在处理高清视频时,Token 序列极长。研究者们发现:

  1. 稀疏性显著:注意力矩阵中绝大部分 Token 之间的权重微乎其微。
  2. 高度持久:虽然不同场景内容各异,但模型“观察”视频的结构化习惯(注意力分布)在不同 Prompt 下是高度一致的。

以往的方法如 Online Decision 需要在推理时动态计算哪些块该跳过,这本身就引入了延迟。

核心机制:CalibAtt 的三板斧

1. 能量驱动的离线校准 (Energy-based Calibration)

作者提出一种离线阶段,针对每组特定的 (层, 头, 时间步),使用少量 Prompt 进行采样。通过计算块能量(Block Energy,即每个块对最终输出的贡献值),CalibAtt 选出累计贡献超过阈值(如 99%)的块,生成一份硬件友好的“静态名单”。

2. 空间重复检测 (Spatial Repetition)

这是本文极具洞察力的一点:作者观察到某些注意力头在空间行之间表现出极高的重复性。对于这些头,CalibAtt 只计算代表性的锚点行(Anchor Rows),然后直接进行广播(Broadcast),大幅削减了 Q 的计算量。

3. 定制化 FlashAttention3 内核

为了让稀疏掩码真正转化为吞吐量的提升,作者开发了基于 FlashAttention3 的定制内核,支持按块粒度的跳过列表(Skip-lists)。

模型架构与流程图 图 1:CalibAtt 的离线校准与在线推理流程,展示了如何从校准集中提取稀疏掩码。

实验战绩:全方位的 SOTA

CalibAtt 在多个主流模型上进行了验证:

  • Wan 2.1 14B (720p):实现了 1.58x 加速,而 VBench 质量评分保持稳定。
  • Mochi 1 (480p):加速效果同样稳健。
  • 蒸馏模型加速:在 4 步生成的 LightX2V 上,依然能提供额外的加速,对比其他在线方法(如 SVG2)在短步骤下的开销,CalibAtt 优势明显。

实验结果对比 表 1:在不同模型与分辨率下的加速对比,CalibAtt 在稀疏度和效率上均名列前茅。

深度洞察

CalibAtt 的成功在于其对模型行为“确定性”的深刻把握。它避开了复杂的在线动态修剪,转而利用模型的固有偏置(Inductive Bias)。

局限性分析:

  • 内存成本:由于需要存储每个时间步的掩码,对于超长步数的推理,显存占用会增加(文中通过跨步共享优化到了 3.6GB 左右)。
  • 一次性开销:校准过程需要约 13-89 个 GPU 小时,但这对于工业化部署来说是一笔极划算的长期投资。

总结

CalibAtt 为视频生成的实时化指明了方向:通过理解模型在注意力空间中的“思维焦点”,我们可以精准地剔除 60% 以上的冗余计算。这一“离线预谋”的策略比实时决策更加稳健,是未来生成式 AI 边缘端落地的关键法门。

发现相似论文

试试这些示例

  • 查找其他最近试图解决大型视频扩散模型中时空冗余问题的最新论文或 SOTA 稀疏注意力方法。
  • 哪篇论文最早探讨了扩散模型注意力图在去噪过程中的时间步持久性,CalibAtt 是如何在这一理论基础上进行改进的?
  • 有哪些研究将基于校准的稀疏策略应用到了 3D 生成或基于 DiT 的多模态大语言模型中?
目录
[CVPR 2025] CalibAtt:视频生成的无痛加速,推理效率提升 58%
1. TL;DR
2. 痛点深挖:计算都在做“无用功”?
3. 核心机制:CalibAtt 的三板斧
3.1. 1. 能量驱动的离线校准 (Energy-based Calibration)
3.2. 2. 空间重复检测 (Spatial Repetition)
3.3. 3. 定制化 FlashAttention3 内核
4. 实验战绩:全方位的 SOTA
5. 深度洞察
6. 总结