SANA-WM:单卡实现 720p 分钟级世界建模,效率提升 36 倍的黑科技

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

2026-01-01
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie
总结
问题
方法
结果
要点
摘要

SANA-WM 是由 NVIDIA 研究团队推出的一个高效开源世界模型(2.6B 参数),专门针对分钟级(60秒) 720p 视频生成设计。它通过混合线性注意力机制(Hybrid Linear Attention)实现了精准的 6-DoF 摄像机轨迹控制,在保持工业级视觉质量的同时,显著降低了训练与推理成本。

TL;DR

在视频生成领域,“分钟级时长”与“高清画质”往往意味着极其昂贵的算力开销。NVIDIA 推出的 SANA-WM (2.6B) 打破了这一僵局。它不仅能根据起始图和 6-DoF 轨迹生存 60 秒的 720p 视频,而且实现了单卡推理(哪怕是 RTX 5090)。相比之前的开源 SOTA,它在动作精度更高的前提下,吞吐量狂飙 36 倍。

核心速览:为什么我们需要 SANA-WM?

目前的世界模型(World Models)如 Sora 或 Genie 2,虽然效果惊艳,但开发者面临三大挑战:

  1. 算力墙:大多数模型需要多卡并行才能跑通分钟级视频。
  2. 控制力:简单的文本提示无法精确描述复杂的相机平移、旋转。
  3. 崩溃现象:时间一长,背景会扭曲,物体会离奇消失。

SANA-WM 的出现,标志着“民主化”长周期世界建模的开始。

痛点深挖:线性注意力的“漂移”与 Softmax 的“臃肿”

传统的 Softmax Attention 显存占用随视频帧数二次方增长,生成一分钟视频简直是显存黑洞。而之前的 Linear Attention 虽然省显存,但缺乏“遗忘”机制,旧特征会无脑堆积造成训练不稳定(Drift)。

作者的洞察非常精妙:我们需要像 RNN 一样可以不断更新、带有“门控遗忘”能力的结构来处理海量帧,但同时需要保留少量的 Softmax 层作为“锚点”来锚定空间一致性。

方法论详解:混合架构与双分支控制

1. 混合线性注意力 (Hybrid Linear DiT)

SANA-WM 层间交替使用 Gated DeltaNet (GDN) 和 Softmax Attention。

  • GDN 分支:负责每一帧的高效递归更新,引入了衰减门(Decay Gate),让模型学会“丢弃旧信息,关注新变化”。
  • Softmax 分支:每四层插入一层,用于周期性的全局回顾,确保物体的布局在长时间跨度下不乱套。

模型架构图

2. 双分支相机控制 (Dual-Branch Camera Control)

为了精准控制相机的 6 自由度(6-DoF)轨迹,SANA-WM 设计了两条路:

  • 粗粒度分支 (UCPE):在 Latent 维度捕捉全局轨迹。
  • 细粒度分支 (Plücker Mixing):在原始帧维度补偿 VAE 压缩导致的动作损失,确保哪怕是微小的震动也能在视频中体现。

实验战绩:单卡 34 秒生成 1 分钟高清视频

在 60 秒世界建模基准测试中,SANA-WM 的表现堪称统治级:

  • 推理效率:使用 NVFP4 量化后,在 RTX 5090 上生成一分钟 720p 视频仅需 34 秒。
  • 动作精度:在旋转误差(RotErr)和位移误差(TransErr)上均显著低于 Infinite-World 和 Matrix-Game 3.0。
  • 视觉质量:配合两阶段细化器(Refiner),SANA-WM 在 VBench 上的综合评分达到了 81.89,比肩工业大模型。

实验结果对比

深度洞察:它对未来意味着什么?

SANA-WM 最核心的贡献不在于模型参数量,而在于架构设计的物理直觉。它平衡了“递归记忆(长周期的低成本)”和“注意力机制(高保真的细节恢复)”。

局限性分析:尽管它在静态场景和相机动作上表现完美,但在处理复杂的人体动态、复杂交互(如接球、打碎玻璃)时仍有短板,这源于其 2.6B 的规模还不足以压缩万物的物理百科。

总结:SANA-WM 为具身智能(Embodied AI)提供了一个极低成本的训练场。如果你只有区区几张显卡,却想训练一个基于视觉反馈的机器人,SANA-WM 就是目前最理想的“数字孪生”引擎。


本文由资深学术技术主编深度解读,转载请注明出处。

发现相似论文

试试这些示例

  • 查找最近其他使用混合线性注意力(Hybrid Linear Attention)或状态空间模型(SSM)进行长视频生成的 SOTA 论文。
  • 哪篇论文最早提出了 Gated DeltaNet (GDN) 架构,本文是如何将其从 Token 级扫描优化为 Frame 级扫描以适应视频任务的?
  • 调研目前除了 UCPE 和 Plücker 之外,还有哪些将 6-DoF 摄像机参数注入 Diffusion Transformer 的主流 Conditioning 技术?
目录
SANA-WM:单卡实现 720p 分钟级世界建模,效率提升 36 倍的黑科技
1. TL;DR
2. 核心速览:为什么我们需要 SANA-WM?
3. 痛点深挖:线性注意力的“漂移”与 Softmax 的“臃肿”
4. 方法论详解:混合架构与双分支控制
4.1. 1. 混合线性注意力 (Hybrid Linear DiT)
4.2. 2. 双分支相机控制 (Dual-Branch Camera Control)
5. 实验战绩:单卡 34 秒生成 1 分钟高清视频
6. 深度洞察:它对未来意味着什么?