SANA-WM:从单图到一分钟的数字世界,单卡即可驱动的 SOTA 世界模型

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

2026-01-01
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie
总结
问题
方法
结果
要点
摘要

SANA-WM 是由 NVIDIA 研究团队推出的 2.6B 参数开源世界模型,专为分钟级(60秒) 720p 视频生成而设计。它通过混合线性 Diffusion Transformer 架构,实现了在单张 GPU 上进行高清长视频合成,并支持精确的 6-DoF 摄像机轨迹控制。

TL;DR

NVIDIA 发布的 SANA-WM (2.6B) 彻底打破了长视频世界模型的“高配”神话。它能够通过一张初始图片和一段 6-DoF 路径,生成长达一分钟、720p 分辨率的高清视频。最令人振奋的是,它的蒸馏版本在 RTX 5090 上仅需 34 秒即可完成一分钟视频的去噪。

痛点深挖:为什么一分钟的视频这么难?

在世界模型(World Models)领域,生成“长且稳”的视频一直是核心痛点。

  1. 内存爆炸:传统的 Transformer 依赖 Softmax Attention,其计算复杂度随 token 数量呈平方增长。对于 720p 分辨率的分钟级视频,token 数量是天文数字。
  2. 控制坍塌:在视频 VAE 进行高度时空压缩后,微小的摄像机移动往往被“压掉”了,导致生成的视频无法精准遵循预设轨迹。
  3. 算力昂贵:现有的模型如 Sora 级工作由于复杂度太高,往往需要多卡并行推理,无法普及到主流开发者手中。

核心架构:混合线性注意力 (Hybrid Linear Attention)

SANA-WM 的秘诀在于它不仅使用了线性注意力。作者观察到,纯线性的线性注意力(Linear Attention)缺乏衰减机制,在超长序列中容易产生数值漂移。

1. 帧级 Gated DeltaNet (GDN)

作者引入了 GDN 块。不同于逐 token 扫描,SANA-WM 采用“帧级扫描”:

  • 每一帧作为一个整体进行状态更新。
  • 利用 Delta Rule 进行状态修正,并加入衰减门(Decay Gate)来遗忘过时信息。
  • 为了保证性能,每 4 个 GDN 块插入一个标准的 Softmax 块,作为全局空间的一致性锚点。

模型架构图

2. 双分支控制:粗精结合

为了解决摄像机控制精度问题,SANA-WM 采用了双轨策略:

  • 粗分支 (UCPE):在 Latent 频率下操作,通过射线基准变换捕捉全局轨迹。
  • 精分支 (Plücker Mixing):在原始像素帧频率下操作,捕捉 VAE 压缩掉的微小抖动,直接将 Plücker Raymaps 注入到注意力输出中。

实验与结果:刷新效率纪录

在包含游戏、室内、城市和自然景观的 60 秒测试基准上,SANA-WM 展现了极强的统治力:

  • 动作遵循 (Action Following):在旋转误差(RotErr)和位移误差(TransErr)上显著低于 Matrix-Game 3.0 等基线。
  • 视觉质量:经过第二阶段 Refiner 处理后,其 VBench 分数高达 81.89,追平了参数量更大的工业级模型。
  • 推理速度:生成 60 秒视频,其吞吐量(Videos/Hour)比同类 480p 模型高出数倍,且能在单块 H100(80GB)或 RTX 5090 上流畅运行。

实验结果对比

深度洞察:世界模型的“轻量化”趋势

SANA-WM 的成功传达了一个重要信号:架构设计优于单纯的参数量堆砌。

  1. 数据标注是隐形护城河:作者通过 Pi3X 和 MoGe-2 自动化生成的 213K 视频位姿数据,是模型能够精准控制的根本。
  2. ** Refiner 的必要性**:即使是 2.6B 的模型,在长程生成中也会出现细节模糊。采用“生成+自适应精修”的两阶段流程,是平衡算力与画质的最佳方案。

局限性

尽管 SANA-WM 在摄像机控制上表现出色,但它目前在处理动态物体(如成群的人、动物)以及超长程(大于一分钟)的场景一致性上仍有改进空间。它缺乏显式的 3D 几何存储,这意味着如果摄像机多次在复杂场景中折返,可能会出现某些细节的“微小变幻”。

总结

SANA-WM 为生成式 AI 进入高频率、长航时的物理模拟领域铺平了道路。它不仅是一个视频生成器,更是一个高效、可控的“模拟器原型”,为未来的具身智能模拟训练提供了廉价的高清环境方案。

发现相似论文

试试这些示例

  • 查找最近其他试图解决 Transformer 在长视频生成中存储 KV Cache 压力问题的论文,特别是结合线性注意力或状态空间模型(SSM)的方法。
  • 哪篇论文最早提出了 Unified Camera Positional Encoding (UCPE),本文在处理视频压缩步长(Temporal Stride)导致的运动丢失时做了哪些关键改进?
  • 研究如何将 SANA-WM 的高效混合注意力架构应用到除摄像机控制外的其他具身智能(Embodied AI)任务中,如机器人手臂的操作控制。
目录
SANA-WM:从单图到一分钟的数字世界,单卡即可驱动的 SOTA 世界模型
1. TL;DR
2. 痛点深挖:为什么一分钟的视频这么难?
3. 核心架构:混合线性注意力 (Hybrid Linear Attention)
3.1. 1. 帧级 Gated DeltaNet (GDN)
3.2. 2. 双分支控制:粗精结合
4. 实验与结果:刷新效率纪录
5. 深度洞察:世界模型的“轻量化”趋势
5.1. 局限性
6. 总结