[arXiv 2026] Scale Space Diffusion:将尺度空间理论融入扩散模型,效率与质量的深度统一
Scale Space Diffusion
本文提出了 Scale Space Diffusion (SSD),这是一种将尺度空间理论(Scale Space Theory)与扩散模型相结合的新型架构。通过将下采样(Downsampling)形式化为一种广义线性退化过程,该方法实现了在不同扩散时间步动态调整图像分辨率,并配套设计了 Flexi-UNet 架构以高效处理多分辨率推理。
TL;DR
传统的扩散模型(Diffusion Models)在加噪阶段只是盲目地添加噪声,而忽略了噪声水平与图像分辨率之间的内在关联。本文提出的 Scale Space Diffusion (SSD) 将图像处理中的经典“尺度空间”概念引入扩散数学框架,通过在高噪声阶段使用低分辨率、低噪声阶段恢复高分辨率,实现了训练与推理效率的双重飞跃。
背景定位:为什么要给扩散模型“降级”?
在学术界,我们已知扩散模型在不同时间步(Timestep )学习的信息类型不同:早期关注轮廓,后期关注细节。
作者提出了一个非常直觉的问题:既然高噪声图像( 较大时)只剩下模糊的轮廓,那我们为什么还要用完整的分辨率去处理它? 这就像是用 4K 屏幕去看一个只有 8x8 像素信息的色块,是极大的计算资源浪费。
核心直觉:扩散时间步与分辨率的等效性
如图 2 所示,作者通过信息论建模发现:
- 扩散过程:随着 增加,高频信息被噪声淹没。
- 尺度空间:随着分辨率 降低,像素合并,高频细节丢失。
这两者的信息降解趋势极其相似。SSD 的核心任务就是:寻找一个严谨的数学框架,让模型在 越大时,对应的分辨率 越小。

技术详解:广义线性扩散与 Flexi-UNet
1. 广义线性扩散过程
作者将传统的加噪公式扩展为包含线性算子 的形式: 当 为下采样算子时,整个过程就变成了尺度空间扩散。
挑战:下采样会导致像素间产生相关性,传统的各向同性(Isotropic)高斯噪声预测不再适用。 方案:作者利用 Woodbury Matrix Identity 推导出了闭式后验解,并利用 Lanczos 算法 对非各向同性协方差矩阵进行隐式平方根计算,从而实现了精确的噪声采样。
2. Flexi-UNet 架构
为了配合不断变化的分辨率,作者改良了 ADM 的 UNet 结构。Flexi-UNet 的特点是:
- 动态激活:低分辨率输入只穿过 UNet 的深层 Block,通过 1x1 卷积进行 Channel 适配。
- 分辨率转换:在需要提升分辨率的时间步,激活不对称的 Up-block 路径。

实验结果:速度与质量的权衡
SSD 在 CelebA 和 ImageNet 上展现了极佳的扩展性。特别是在高分辨率(256x256)任务中,SSD (6L) 相比标准 DDPM:
- 训练速度:提升 100%+(耗时从 87h 降至 42h)。
- 计算量:GFLOPs 从 497 降至 209。
- 推理鲁棒性:在减少采样步数(250步)时,SSD 的 FID 恶化程度远低于传统模型,显示出其尺度空间建模带来的结构先验优势。

总结与洞察
Scale Space Diffusion 不仅仅是一个性能优化的 Trick,它通过数学手段统一了计算机视觉中两个最基础的层级表示。它告诉我们:生成过程中的空间精度应当与内容确定性(Signal-to-Noise Ratio)动态匹配。
局限性:尽管 SSD 在物体轮廓(低频)捕捉上非常出色,但在某些复杂纹理的 ImageNet 类别上,多级分辨率转换可能会引入微小的瑕疵(FID 略微上升)。未来的方向可能是将此思路引入基于 Transformer 的架构(如 DiT),利用 Patch 数量的变化来实现更灵活的尺度空间。
