SANA-WM:单 GPU 实现分钟级 720p 世界建模,高效动作控制的新范式
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
SANA-WM 是由 NVIDIA 团队提出的一种高效视频世界模型,具有 2.6B 参数量,专为生成一分钟长、720p 分辨率的高保真视频而设计。它通过 Hybrid Linear Diffusion Transformer 架构,在单张 H100 GPU 上即可实现分钟级视频生成和精确的 6-DoF 摄像机控制。
TL;DR
NVIDIA 推出的 SANA-WM 标志着开源世界模型(World Models)进入了“高效长时程”时代。这是一个拥有 2.6B 参数的扩散 Transformer 模型,能够根据首帧图片和 6-DoF 摄像机轨迹,原生生成一分钟长、720p 高清视频。相比于以往动辄需要 8 卡 H100 推理的巨型模型,SANA-WM 不仅能在单卡运行,且在动作遵循准确度上刷新了 SOTA 纪录,同时训练成本极低(64卡、15天)。
痛点深挖:长序列与精确控制的矛盾
构建视频世界模型面临着一个三全其美的难题:
- 内存爆炸:传统的 Softmax Attention 随序列长度呈平方增长,处理 60 秒视频(约 960 帧)时显存会瞬间溢出。
- 动作坍塌:在进行 8x 或更强的 VAE 压缩后,细微的摄像机移动信息被丢失,导致生成的视频虽然好看,但并未遵循给定的轨迹。
- 数据稀缺:带有精确摄像机位姿(Metric-scale 6-DoF Pose)的长视频数据集极难获取,现有公开数据质量参差不齐。
核心技术:混合线性注意力架构与双分支控制
1. 混合线性注意力(Hybrid Linear Attention)
为了突破长度限制,SANA-WM 基于 SANA-Video 进行了重大改造。它并不是简单地堆叠 Softmax,而是采用了 Gated DeltaNet (GDN)。
- 帧级递归 (Frame-wise GDN):作者将 GDN 从处理单个 Token 的递归改为逐帧递归。这种设计允许模型以常量显存维护一个 的状态矩阵,随着视频变长,显存占用保持平稳。
- 周期性锚点:为了防止线性注意力的长期漂移(Drift),模型每 4 层插入一层标准的 Softmax Attention,作为“全局记忆锚点”,确保场景身份不丢失。
上图展示了 SANA-WM 的整体架构,清晰可见 GDN 与 Softmax Block 的交错设计及摄像机控制逻辑。
2. 双分支摄像机控制方案
为了让视频严丝合缝地贴合轨迹,SANA-WM 采用了两手抓的策略:
- 粗粒度分支 (Local UCPE):在隐空间尺度,通过统一视角位置编码捕捉全局 6-DoF 姿态。
- 细粒度分支 (Plücker Mixing):在原始像素尺度,将 VAE 压缩前的 8 帧 Plücker 光线图(Raymaps)直接注入,补偿压缩带来的动态损失。
实验战绩:低成本、高性能
在与 LingBot-World、HY-WorldPlay 等工业级基线的对比中,SANA-WM 展现出恐怖的效率优势:
- 推理速度:在 720p 分辨率下,SANA-WM 在 H100 上的吞吐量达到 22.0 videos/hour,比之前的 480p 基线快了近 4 倍。
- 端侧潜力:其蒸馏后的 NVFP4 版本在民用卡 RTX 5090 上,仅需 34 秒 就能跑完一分钟视频的去噪。
- 控制精度:在 Hard 轨迹测试中,其旋转误差(RotErr)和位移误差(TransErr)显著低于其他模型。
表格对比显示,SANA-WM 在单卡推理(#G=1)的情况下,其 VBench 总分与动作准确度全面超越或对齐了多卡并行模型。
深度洞察:为什么这篇论文很重要?
SANA-WM 的成功在于它深刻理解了“效率即能力”。通过引入 二阶段细化(Refiner),它允许基础生成器专注于“生成正确的几何结构”,而将“增强视觉细节”交给一个轻量级的 LoRA 适配器。这种“先求对、再求美”的设计哲学,对于需要在有限资源下进行大规模模拟的学术界和中小型初创公司来说,极具启发意义。
局限性与展望
尽管表现卓越,SANA-WM 在高度动态、物体剧烈变化的场景中仍存在漂移。此外,它目前缺乏显式的 3D 表征记忆。作者指出,未来的方向将是引入更持久的 3D/4D 场景存储,并探索更复杂的机器人抓取等交互控制。
总结
SANA-WM 不仅仅是一个更快的视频生成器,它是一个可用的、可负担的、高精度的“数字孪生”引擎。它向我们展示了:只要架构设计得当,一分钟的长时程高质量仿真,并不一定需要烧掉整座机房的算力。
