[DLM 加速] LSP 调度器:告别碎片化碎片化,开启扩散语言模型的块状高效推理
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
本文提出了 Longest Stable Prefix (LSP) 调度器,这是一种旨在加速扩散语言模型(DLMs)推理的无须训练且模型无关的方法。通过将“分散接受”转变为“单一块状前缀吸收”,LSP 在 LLaDA-8B 和 Dream-7B 等模型上实现了高达 3.4 倍的推理加速。
TL;DR
传统的扩散语言模型(Diffusion Language Models, DLMs)虽然在理论上支持并行文本生成,但由于其“分散式”的 Token 提交策略,导致推理速度在硬件层面大打折扣。阿里 Accio 团队与清华大学提出的 Longest Stable Prefix (LSP) 调度器,通过锁定“最长稳定前缀”打破了这一瓶颈,在不损失质量的前提下,将推理速度提升了 2-3.4 倍。
背景定位:DlM 的“并行悖论”
与传统的自回归(Autoregressive)模型不同,DLM 能同时预测整个序列。然而,这种并行性往往是“名义上的”。现有的调度器喜欢在序列的各个位置随机挑选高置信度的 Token 进行锁定(Scattered Acceptance)。
这种做法产生了两个致命问题:
- 算法层面的“边界危机”:锁定的 Token 像孤岛一样分散,孤岛之间的修补(Repair)过程非常缓慢,容易导致语义不连贯。
- 系统层面的“Cache 粉碎”:对 Transformer 而言,KV Cache 的连续性是性能命脉。分散的锁定会让 KV Cache 变得支离破碎,推理开销居高不下。
核心直觉:为什么“前缀”优于“分散”?
LSP 的核心思想极其朴素却有力:与其到处撒网,不如稳步前行。
作者观察到,DLM 在推理过程中,序列前半部分的 Token 往往比后半部分更快达到稳定状态。通过维持一个单调增长、块状连续的已确认前缀(Frozen Prefix),我们可以:
- 硬件协同:让 KV Cache 实现高效的顺序追加(Append),而非随机插入。
- 上下文稳定:利用扩散模型的双向注意力,在一个清晰、连贯的已知前缀基础上,让模型更专注于“未来”的生成。
图 1:LSP 调度器示意。绿色部分为锁定的前缀,白色为动态缩减的活动后缀。通过单次 Forward Pass,模型自动决定本次要“吸收”进前缀的最佳长度。
技术拆解:LSP 的三支箭
1. 稳定性诊断 (Stability Diagnostic)
LSP 使用 top-1 和 top-2 概率之间的 Logit Margin () 作为稳定性的低成本代理指标。如果当前位置的最高概率远超第二名,则认为该位置已“稳定”,可以被吸收进前缀。
2. 自适应阈值 (Adaptive Sizing)
固定的阈值是脆弱的。LSP 会根据当前活动后缀的长度 ,动态搜索一个阈值,使得被选中的前缀长度恒定在总长的 25%~50% 之间。这种几何级数衰减策略确保了推理步数被压缩到对数级别。
3. 结构化捕捉 (Structural Snapping)
这是 LSP 保证文字质量的绝招。如果稳定性计算建议提交 10 个词,但第 8 个词刚好是一个逗号或句号,LSP 会“捕捉”到这个边界(Boundary Snapping)。这样可以避免将“答案是 3.1”这种不完整的片段硬性冻结,从而给下一步推理留出更自然的起点。
实验战绩:全线飘红
在 LLaDA-8B 和 Dream-7B 上的测试结果显示,LSP 在几乎所有任务上都表现优异:
- 数学与推理:在 GSM8K 上加速 1.5x 以上。由于减少了不连贯片段的干扰,准确率反而提升。
- 代码生成:加速 1.2x-1.4x。代码天然具有缩进和标点等定界符,与 LSP 的捕捉机制完美契合。

深度洞察:Token Flip Rate
为了验证“锁定前缀是否会限制模型纠错”,作者引入了 Token Flip Rate 这一指标。实验发现(见下图),LSP 的策略将后期 Token 的翻转率(即预测改变的频率)从 14.2% 降到了 4.3%。这意味着,早期锁定一个连贯的前缀,不仅没有限制未来,反而为未来的生成扫清了障碍。

资深主编点评
LSP 是一个非常典型的“以简御繁”的工作。它没有修改模型架构,也没有复杂的 RL 训练,而是深刻洞察了 Transformer 硬件推理效率(KV Cache)与拡散算法收敛特性之间的不匹配。
局限性:由于它强依赖于“从左向右”的前缀增长,对于非线性的文本编辑或填空任务,其优势会减弱。未来的研究方向在于如何将这种“稳定拓扑”扩展到“稳定孤岛(Stable Islands)”的多位置并发增长。
总结:对于正在落地 DLM 的团队来说,LSP 是一个必备的 Inference-time 插件,能够以极低的成本换取显著的硬件吞吐提升。
