[ICLR 2026] Self-Flow:告别外部编码器,自监督 Flow Matching 开启生成模型的新 Scaling 时代
Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
本文提出了 Self-Flow,一种自监督 Flow Matching 范式,通过 Dual-Timestep Scheduling 机制在生成模型内部集成表征学习。该方法在不依赖外部预训练模型的情况下,实现了在图像(ImageNet FID 5.70)、视频(FVD 47.81)及音频生成任务中的 SOTA 表现,并展现了极佳的多模态可扩展性。
TL;DR
传统的生成模型(如 Stable Diffusion, Flux)通常需要“外挂”一个 DINO 或 SigLIP 编码器来学习语义,但这就像给发动机加了一层限速器。本文提出的 Self-Flow 彻底摒弃了外部编码器,通过独特的 Dual-Timestep Scheduling 机制,让模型在学习“如何生成”的同时,自主学会“如何理解”。结果是惊人的:它在图像、视频、音频全模态上刷写了 SOTA,且模型规模越大,优势越明显。
背景定位:外部对齐的“天花板效应”
在目前的技术背景下,由于扩散模型(Diffusion)或流匹配模型(Flow Matching)的原始训练目标只是简单的“去噪”,模型往往倾向于关注局部像素而忽略全局语义。为了解决这个问题,学术界此前流行 Representation Alignment (REPA) —— 强迫生成模型的中间层去对齐外部预训练模型(如 DINOv2)的特征。
但是,作者发现了一个令人不安的现象: 使用更强的外部编码器(如 DINOv3-H)进行对齐,生成的图像质量(FID)反而会变差(见下图)。这种“不兼容”限制了模型的缩放潜力。

核心动机:为什么要通过信息不对称来学习?
作者的直觉(Insight)非常深刻:如果所有的 token 同时变模糊,模型只需要看周边的像素就能还原,不需要理解语义。 Self-Flow 的逻辑是: 如果我把一部分像素变得非常模糊(高噪声),而保留另一部分相对清晰(低噪声),那么模型为了还原那些极度模糊的部分,就必须利用那些清晰部分的“语义”进行推断。
方法论详解:Dual-Timestep Scheduling
这是本文最精妙的设计。它不像传统的 Masked Autoencoder (MAE) 直接把像素抹除,因为那样会造成 Train-Inference Gap(推理时没有 Mask,模型会无所适从)。
- 异构噪声:在同一次训练中,对一个 Batch 的 token 随机分配两个不同的时间步 和 。
- 信息不对称:Student 看到的是混合噪声的版本,而 EMA Teacher 看到的是全量低噪声(较清晰)的版本。
- 自监督目标:Student 的优化目标不仅要预测噪声(常规 Flow Loss),还要预测 Teacher 在对应位置产生的特征表示(Alignment Loss)。

实验与结果:全线碾压
1. 突破 ImageNet SOTA
在经典的 ImageNet 1K 任务上,Self-Flow 在没有外部标签或编码器的情况下,FID 达到了 5.70,首次在自监督设定下击败了显式使用外部 DINO 对齐的方法。
2. 多模态通用性
尤其在视频(Video)和音频(Audio)领域,外部编码器往往会起反作用。Self-Flow 在视频生成中展现了极强的时空一致性,FVD 达到了 47.81,大幅领先。

3. 文字渲染能力的飞跃
值得一提的是,自监督学习带来的语义理解力直接体现在了极难的“文字渲染”上。如下图所示,Self-Flow 生成的排版准确度远高于传统的 Flow Matching。

深度洞察与总结
解析:为什么有效?
Self-Flow 成功的本质在于它解决了一个悖论:生成模型需要判别模型的特征,但判别模型的特征未必适合生成。 通过让模型“左手倒右手”(利用 EMA Teacher),模型自动筛选出了那些对生成任务最有帮助的语义表征,且这种表征会随着模型规模的扩大而自动增强。
局限性与未来
- 计算开销:由于涉及两次 Forward(Student 和 Teacher),训练时间增加了约 30-50%,但考虑到收敛速度的加快,这个成本是可接受的。
- 未来展望:这项技术为“世界模型”(World Models)提供了新的思路。在具身智能任务中,Self-Flow 展示了更强的复杂推理能力,未来可能成为视频-动作联合预测的标准范式。
资深主编评价:Self-Flow 是对“暴力对齐”路线的一次有力反思。它证明了 Generative 和 Discriminative 并不是对立的,而是可以通过精巧的噪声调度在同一个 Backbone 中完美融合。
