[ICLR 2025(?)] TDM-R1:少步扩散模型的“R1时刻”,非微分奖励下的效率与质量飞跃
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
本文提出了 TDM-R1,一种针对少步(Few-step)扩散模型的强化学习(RL)框架。该方法结合轨迹分布匹配(TDM)的确定性采样,利用非微分奖励(Non-differentiable rewards)进行后训练,在仅需 4 步推理的情况下(4 NFE),在 GenEval 和文本渲染任务上达到了 SOTA 性能。
TL;DR
在 AIGC 领域,提升生成速度(少步生成)和对齐复杂指令(RLHF)通常是一对矛盾。本文提出的 TDM-R1 成功打破了这一僵局。它首次实现了在非微分奖励(如 OCR 准确性、人类点赞)下,对 4 步采样(4-step)的扩散模型进行高效强化学习。实验显示,经过 TDM-R1 增强后的 4 步模型,在 GenEval 榜单上以 92% 的高分碾压了 GPT-4o 和 80 步推理的 SD3.5-M。
核心痛点:为什么“快”和“准”很难兼得?
目前的少步生成技术(如 Distillation, TDM)虽然将扩散模型加速了 50 倍,但在复杂场景(如文字渲染、精确位置控制)中经常“翻车”。
传统的 RL 方案主要面临三大障碍:
- 奖励不可导:多数现实奖励(如“这张图中是否有 5 只猫”)是离散且不可导的,无法通过反向传播训练。
- 中间态缺失:扩散过程是连续的,但奖励通常只定义在最终的清洁图像()上,很难判断中间步骤()哪一步做得好。
- 去噪偏移(Blurring):直接在少步模型上强行套用标准扩散 RL 的 Loss,会导致结果变得像打了马赛克一样模糊。
TDM-R1:解耦与确定性的力量
TDM-R1 建立在 Trajectory Distribution Matching (TDM) 之上,其核心直觉是:既然我们无法直接求导反馈,那就构建一个“懂行”的代理奖励模型 (Surrogate Reward)。
1. 确定性轨迹:奖励分配的“上帝视角”
TDM 使用 ODE(普通微分方程)式的采样,这意味着从噪声到图像的路径是确定性的。 作者推导证明:通过确定性路径,我们可以获得中间步骤奖励的无偏估计。这就像给算法开了一个“电影回放”,每一步对结局的贡献都清晰可见,极大地降低了训练方差。
可以看到,TDM-R1 的收敛速度和上限远高于传统 RL 组合。
2. 组偏好优化 (Group-based Optimization)
借鉴了 LLM 领域(如 DeepSeek-R1, GRPO)的思路,TDM-R1 对同一 Prompt 生成的一组候选图像进行横向对比,利用 Bradley-Terry 模型学习“哪张更好”,从而训练出能感知细微差异的代理奖励模型。
实验战绩:4 步吊打 80 步
在最具说服力的 GenEval(组合生成基准)上,结果令人震惊:
- TDM-SD3.5-M (4-step) 原本分数仅为 61%。
- TDM-R1 (4-step) 增强后直接飙升至 92%。
- 作为对比,GPT-4o 仅为 84%,而需要 80 次推理的原始 SD3.5-M 也仅有 63%。

在文字渲染任务(OCR 准确率)中,TDM-R1 同样展现了霸榜实力,生成的文字不再是各种“火星文”,而是清晰、准确的拼写。
上图对比了不同变体在文字对齐上的表现,TDM-R1 的文字清晰度与准确性显著提升。
笔者洞察:RL 改写少步生成的格局
TDM-R1 的成功标志着:少步生成不再只是原始模型的“劣化简化版”。通过适当的 RL 后训练,我们可以利用其极高的采样效率(由于 NFE 低,RL 的训练 Rollout 本身就快得多)反复进行自我演化。
局限性预测:虽然在 4 步采样上表现惊人,但对于需要极高纹理细节(如 1 步超轻量生成)的场景,非微分奖励的反馈信号可能仍然过于稀疏,需要更强的先验指引。
总结:TDM-R1 证明了,只要解决了中间奖励分配的偏差问题,少步模型完全可以胜任指令对齐任务,甚至在效率和精度上双双超越传统笨重的多步模型。
