[WorldCache] 扩散世界模型加速新范式:免费换取 3.7 倍推理性能
WorldCache: Accelerating World Models for Free via Heterogeneous Token Caching
本文提出了 WorldCache,一种专为扩散世界模型(Diffusion World Models)设计的无须训练的推理加速框架。通过引入曲率引导的异构 Token 预测和非平稳时间自适应跳过机制,WorldCache 在保持 98% 生成质量的同时,实现了高达 3.7 倍的端到端加速。
TL;DR
扩散世界模型正成为物理世界模拟的新底座,但其迭代去噪的巨大计算成本限制了交互式应用。本文提出的 WorldCache 是一种无须训练的通用插件,它通过“看人下菜碟”的方式,为不同特征形态的 Token 分配不同的缓存策略。在几乎不损失画质和几何一致性的前提下,将推理延迟降低了 70% 以上,且显存开销近乎为零。
背景定位:世界模型为何不能直接搬用图片缓存技术?
在传统的图片生成中,特征往往是空间均匀演化的。但在 World Models(如 Voyager 或 Aether)中,模型需要同时预测 RGB、深度(Depth)以及物理运动。
作者发现,世界模型存在两个致命的缓存障碍:
- 长尾难度分布 (Long-tailed Difficulty):大部分背景 Token 极其稳定,但少数处于运动边界或深度突变处的 Token 演化极快。
- 瓶颈驱动失效 (Bottleneck-driven Failure):全局的缓存误差往往是由这极少数“混沌 Token”引起的,一旦它们预测失败,整个世界的物理逻辑就会崩塌。
核心方法论:曲率驱动的异构演进
1. 异构 Token 预测 (CHTP)
WorldCache 不再对所有 Token 一视同仁。它引入了物理学中的曲率 (Curvature) 概念来衡量 Token 轨迹的非线性程度。

- Stable Tokens (低曲率):直接重用(Reuse),节省计算。
- Linear Tokens (中曲率):采用一阶线性外推(Linear Extrapolation)。
- Chaotic Tokens (高曲率):这是最难处理的部分,作者设计了一个基于 Hermite (厄米特多项式) 引导的阻尼预测器,防止预测方向在剧烈变动中发散。
2. 混沌优先的自适应跳过 (CAS)
什么时候该停止“偷懒”,进行一次全量的网络推理?WorldCache 放弃了传统的全局均方误差(MSE)阈值,转而监控那些“混沌 Token”的累积漂移。通过数学证明,作者推导出了一个无量纲 (Dimensionless) 的漂移指标,解决了不同模态、不同去噪阶段特征尺度不统一的问题,使得一个全局阈值 就能通吃所有场景。
实验与结果:速度与质量的终极平衡
在大模型 HunyuanVoyager-13B 上,WorldCache 展示了统治级的表现。

- 极致加速:在 Voyager 上达到了 3.65x 的端到端加速,将原本需要一千多秒的生成任务缩短到了不到三百秒。
- 无损质量:WorldScore(衡量世界生成质量的指标)仅从 46.40 微降至 45.43,远优于其他基线方法。
- 几何守恒:在 3D 重建实验中,WorldCache 预测的深度图和相机轨迹几乎与原始模型一致,这对于自动驾驶或机器人仿真等下游任务至关重要。
可视化对比
从下图可以清晰看到,传统的 TeaCache 等方法在复杂边缘(Inset 放大图)会出现明显的模糊或色彩漂移,而 WorldCache 保持了极其锐利的边缘和稳定的深度一致性。

深度洞察:为什么 WorldCache 有效?
WorldCache 的成功在于它抓住了“二八定律”:即 20% 的硬核 Token 决定了 80% 的生成质量。 通过引入物理意义明确的曲率感官,它实现了对算力的精准按需分配。相比于那些通过层级别缓存(会导致内存爆炸,如 DuCa/ToCa)的方法,WorldCache 在模型输出端进行 Token 级别的动态管理,既保住了速度,又保住了显存,是真正的“加速免单”。
总结与局限
虽然 WorldCache 表现惊艳,但其性能高度依赖于前三个 Full 计算步来初始化曲率。在极短序列的生成中,这种“预热时间”可能占比略高。未来的研究方向可以将这种异构思想进一步下放到 Transformer 内部的注意力机制中,实现更深层次的计算压缩。
对于追求实时性的自动驾驶世界模型或交互式 AI 客服,WorldCache 无疑是当前最值得部署的加速方案。
