SANA-WM:从单张图到无限世界,分钟级高效 720p 世界模型
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
NVIDIA 团队推出了 SANA-WM,这是一个参数量为 2.6B 的开源视频世界模型,专注于高效生成分钟级 720p 视频。该模型采用混合线性 Diffusion Transformer (Hybrid Linear DiT) 架构,结合了 Gated DeltaNet (GDN) 与 Softmax 注意力,在仅使用 64 张 H100 训练 15 天的情况下,实现了具备精确 6-DoF 相机轨迹控制的长视频合成。
TL;DR
NVIDIA 的研究团队发布了 SANA-WM,通过一个仅 2.6B 参数的 Hybrid Linear Diffusion Transformer 架构,实现了在一分钟时长内保持高度一致性的 720p 视频生成。它不仅支持精确的 6-DoF 轨迹控制,更将原本需要多卡并行推理的任务,压缩到单张消费级显卡(如 RTX 5090)即可在半分钟内完成。
背景定位
目前世界模型(World Models)领域正处于“既要、又要、还要”的矛盾中:既要长视频的场景持久性,又要高分辨率的视觉细节,还要实时的交互响应。传统的 DiT 架构受限于 Softmax 注意力的二次复杂度,在这三者之间难以平衡。SANA-WM 的出现,标志着计算效率不再是大规模长时序仿真的瓶颈。
核心痛点:为什么长视频世界模型这么难?
- 显存爆炸:标准的 Self-attention 在处理分钟级文本/视频 token 时,KV Cache 的增长会让 H100 也感到力不从心。
- 动作漂移 (Action Drift):在长时间步的 rollout 过程中,微小的控制误差会累积成严重的几何变形。
- 场景遗忘:当相机旋转 360 度重新回到原点时,模型往往忘了几十秒前该位置应有的物体。
关键技术详解 (Methodology)
1. 混合线性注意力 (Hybrid GDN-Softmax)
为了破除注意力机制的长度魔咒,SANA-WM 采用了 Gated DeltaNet (GDN)。
- 物理直觉:GDN 类似于一种带门控的递归记忆单元。论文将其从传统的“逐 token 扫描”改为“逐帧扫描”,每一步处理一帧的所有空间 token,将状态维持在定长的 矩阵中。
- 混合策略:每隔 4 层 GDN 插入一层标准的 Softmax 注意力。这一设计保留了线性注意力的计算效率,同时利用 Softmax 提供的强关联能力确保持久的场景记忆。
图 2:SANA-WM 架构,展示了文本、视频和位姿 Token 如何在交替的 GDN 与 Softmax 块中流转。
2. 双分支相机控制 (Dual-Branch Camera Control)
SANA-WM 采用了“由粗到细”的控制策略:
- 粗粒度 (Coarse Branch):基于 UCPE (Unified Camera Positional Encoding),由于视频潜空间被高度压缩,UCPE 负责捕捉帧间的全局轨迹结构。
- 细粒度 (Fine Branch):利用 Plücker Mixing 模块。由于每一帧潜变量包含了 8 帧原始视频的信息,Plücker 射线图能补偿压缩过程中损失掉的帧内精细相机跳动。
3. 两阶段视觉精炼 (Two-Stage Refinement)
第一阶段由 SANA-WM 生成低噪声的粗样;第二阶段利用一个独立的 Refiner(基于 17B LTX-2 蒸馏所得)对长视频进行结构修正和锐化。这种“先成型、后雕琢”的方法在保证推理速度的前提下,极大提升了 VBench 视觉评分。
实验结果与战绩
SANA-WM 在 60 秒世界模型基准测试中展现了统治力:
- 精度:在 Simple 与 Hard 两种轨迹测试下,其相机遵循误差 (RotErr/TransErr) 均为开源界最低。
- 效率:吞吐量达到 24.1 视频/小时(720p 60fps),比 Matrix-Game 3.0 快了近 8 倍。
- 稳定性:引入 Refiner 后,长时序视觉漂移显著降低(ΔIQ 从基线的接近 20+ 降低至 1.17)。
表 2:SANA-WM 在位姿精度和视觉质量上均达到或超过了规模更大的工业级基线。
深度洞察
SANA-WM 的真正意义在于它民主化了长时序仿真器的训练。仅需 21.3 万个视频片段和 15 天的 64-H100 训练量,就能产出一个能够处理无限场景(Infinite Worlds)的世界模型。
然而,论文也坦诚模型存在局限性:尽管几何一致性很强,但在复杂的动态交互(如人与物体之间的深度接触)方面仍存在漂移。
总结
SANA-WM 是一次成功的“架构降级”与“控制升级”的结合。它告诉我们,通过引入符合物理直觉的线性递归机制与双重几何约束,我们不需要万亿参数的巨型模型,也能在普通显卡上跑出电影级、长距离的数字孪生世界。
本文由资深学术技术主编重构。
