[AMD 2026] DC-DiT:打破固定 Patch 限制,扩散 Transformer 的内容自适应革命

Dynamic Chunking Diffusion Transformer

总结
问题
方法
结果
要点
摘要

本文提出了 Dynamic Chunking Diffusion Transformer (DC-DiT),一种采用端到端学习的动态分块机制的新型扩散 Transformer 架构。该方法通过一个 Encoder-Router-Decoder 结构,实现了根据图像内容复杂度及扩散时间步(Timestep)自适应调整 token 序列长度,在 ImageNet 256x256 任务上刷新了同等计算量下的 SOTA 性能。

TL;DR

传统的 Diffusion Transformer (DiT) 就像一个死板的画家,无论画背景还是画眼睛都用同样细的笔触。AMD 研究团队提出的 DC-DiT (Dynamic Chunking Diffusion Transformer) 彻底改变了这一点。它采用一种可学习的动态分块机制,让模型自动学会:在无聊的背景和嘈杂的扩散早期使用极少的 Token,而在细节丰富的物体和去噪后期增加计算投入。这不仅提升了推理速度,更在 FID 指标上显著超越了传统的固定 Patch 方案。

核心速览

  • 核心痛点:DiT 固定的分块操作对所有区域和时间步一视同仁,计算资源分配效率低下。
  • 创新方案:引入带路由机制的 Encoder-Router-Decoder 支架,实现端到端的 Token 动态压缩与恢复。
  • 关键成果:在 ImageNet 256×256 上,DC-DiT 在多个尺度下(B/XL)均优于参数匹配和 FLOPs 匹配的 Baseline,并支持从预训练 DiT “无损升级”(Upcycling)。

痛点深挖:为什么固定的 Patch 会限制扩散模型?

目前的扩散模型(如 Sora, DiT)大多将图像切成固定大小的 Patch(如 2x2 或 4x4)。这种设计存在两个自然的直觉缺失:

  1. 空间冗余:蓝天和复杂的纹理在 Token 数量上竟然是平等的,这显然不符合计算效率。
  2. 时间阶段性:扩散的早期(高噪声阶段)主要生成轮廓,并不需要极细的 Token 分辨率;只有到了后期细节填充时,精细采样才有意义。

方法论详解:DC-DiT 的动态引擎

DC-DiT 的核心是为 DiT 穿上了一层“自适应外壳”。

1. 动态分块架构 (Overview Architecture)

DC-DiT 并没有改变内部的 Transformer Blocks,而是在其外层包裹了:

  • Encoder:聚合邻近 Token 的上下文信息,为路由做准备。
  • Router (Chunking Layer):根据相似度决定哪些 Token 是“边界”(保留),哪些是“非边界”(丢弃)。
  • Inner DiT:在一个被大幅压缩的短序列上进行高性能去噪。
  • De-chunking & Decoder:通过空间平滑(Spatial Smoothing)和插值,将短序列还原回原始分辨率。

模型架构图

2. 空间感知的路由逻辑

为了让 Router 在 2D 空间工作,作者设计了一个巧妙的相似度度量(Similarity Score)。通过 3x3 的深度卷积计算邻域 Token 的平均相似度,如果当前 Token 与周围很像(相似度高),边界概率 就低,该 Token 就会被合并。

3. 时间步自适应

最令人惊喜的是,这种压缩是随时间动态变化的。由于路由概率是通过扩散时间步 条件化的,模型学会了在 较大(噪声大)时激进压缩序列长度,从而显著节省推理预算。


实验与结果:全方位的性能碾压

SOTA 对比

在 class-conditional ImageNet 256×256 任务中,DC-DiT 表现极其抢眼。在 XL 规模下,即使压缩率高达 16x,DC-DiT 的 FID (13.60) 依然远好于同等算力的传统 DiT (16.35)。

实验结果对比

自发涌现的图像分割

研究发现,虽然没有给模型任何分割标签,但 Router 自动学会了识别物体边缘。如下图所示,红点(保留的 Token)精准地捕捉到了物体的轮廓和复杂纹理,而背景区域则被大面积压缩。

边界预测可视化

Upcycling 与蒸馏

为了让现有的预训练模型不至于浪费,DC-DiT 方案支持 Upcycling。通过短短 50K 步的“激活蒸馏”(Activation Distillation),不到 15% 的训练成本就能让已有模型具备动态计算能力,且效果优于从头训练。


深度洞察与总结

为什么 DC-DiT 有效?

  1. 更有意义的注意力:通过剔除冗余 Token,Transformer 的 Attention 机制能更集中地学习复杂区域的交互。
  2. 多尺度归纳偏置:这种架构在无形中引入了类似金字塔结构的视觉特征处理方式,但比传统金字塔更灵活(按需分配)。

局限性与未来

尽管性能强大,但 DC-DiT 在实现时需要处理变长的 Token Batch,这对于现有的部分硬件加速框架仍有优化空间。此外,虽然在图片生成上效果卓著,但其在视频生成(需处理 3D Token 块)中的一致性还有待进一步验证。

Takeaway: DC-DiT 告诉我们,未来的 AI 模型不应该是静态的计算图,而应该是能根据输入数据的“疏密”和推理阶段的“难易”来自发调整形状的自适应实体。

发现相似论文

试试这些示例

  • 查找最近其他尝试将扩散模型的计算量与图像空间复杂度和扩散时间步进行动态关联的论文,例如采用动态 VAE 或 token 剪枝的方法。
  • 追溯 H-Net 动态分块(Dynamic Chunking)理论的来源,并分析本文如何将其从 1D 因果序列建模成功迁移至 2D 非因果空间布局。
  • 探索 DC-DiT 提到的“Upcycling”技术在其他大模型架构转换中的应用,特别是如何利用知识蒸馏加速新模块与预训练 Backbone 的适配。
目录
[AMD 2026] DC-DiT:打破固定 Patch 限制,扩散 Transformer 的内容自适应革命
1. TL;DR
2. 核心速览
3. 痛点深挖:为什么固定的 Patch 会限制扩散模型?
4. 方法论详解:DC-DiT 的动态引擎
4.1. 1. 动态分块架构 (Overview Architecture)
4.2. 2. 空间感知的路由逻辑
4.3. 3. 时间步自适应
5. 实验与结果:全方位的性能碾压
5.1. SOTA 对比
5.2. 自发涌现的图像分割
5.3. Upcycling 与蒸馏
6. 深度洞察与总结
6.1. 为什么 DC-DiT 有效?
6.2. 局限性与未来