[综述] LLM 后训练的终局:从算法堆砌到行为干预的统一视角
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
本文提出了一个统一的大语言模型(LLM)后训练(Post-training)框架,核心贡献是建立了基于“轨迹溯源(Trajectory Provenance)”的分类学,将现有方法归纳为离策学习(Off-policy)和同策学习(On-policy),并定义了支持扩展、策略重构和行为整合三大功能角色,旨在解决当前后训练研究在 SFT、RLHF、蒸馏等领域割裂的问题。
TL;DR
在 LLM 的研发进入深水区的当下,单纯堆砌 SFT 数据或刷榜 RLHF 已不再足够。南开大学与华为的研究团队发布长篇综述,打破了传统的“方法论孤岛”,提出大语言模型后训练本质上是对模型行为的结构化干预。文章核心建立在两个维度上:轨迹是从哪来的(Off-policy vs. On-policy)?干预起到了什么作用(支撑扩展 vs. 策略重构 vs. 行为整合)?
痛点深挖:为什么我们对后训练的理解是碎片化的?
过去几年,我们习惯于将指令微调(Instruction Tuning)、偏好优化(DPO/PPO)、强化学习(RLVR)甚至蒸馏(Distillation)看作平行或互斥的概念。然而,对于一个前沿系统(如 Llama 3 或 DeepSeek),这些方法往往被串联成极其复杂的流水线。
传统的分类法无法回答:
- 为什么 SFT 之后一定要接 RLFF?
- 为什么 DPO 在离线数据集上有效,但在长程推理任务中往往不如在线 RL?
- 蒸馏仅仅是为了压缩模型吗?
本论文认为,这些方法都在干预同一个对象:由模型定义的轨迹分布(Trajectory Distribution)。
核心框架:轨迹溯源与功能角色
1. 轨迹溯源 (Trajectory Provenance)
这是本文最基础的分类轴:
- Off-policy (离策):模型在外部供应的轨迹上学习(如人类专家数据、SFT 语料)。
- On-policy (同策):模型在自己生成的采样轨迹上学习(如 RLHF 过程中的实时 Rollouts)。
2. 三大功能角色 (Functional Roles)
这是理解“Why it works”的关键物理直觉:
- 支持扩展 (Support Expansion):让模型原本“几乎不可能”生成的正确行为变得“可能”。SFT 通常扮演这个角色。
- 策略重构 (Policy Reshaping):在模型已经“会”的行为中,把好的概率拨高,坏的拨低。DPO 和 RL 往往在此发力。
- 行为整合 (Behavioral Consolidation):系统层面的“存盘”操作。确保模型在经历了复杂训练后,能力不丢失、能迁移、能压缩。

方法论:公式背后的物理直觉
作者引入了从强化学习借来的 有效支持 (Effective Support) 概念:
简单来说,这定义了在一个给定的提示词分布下,模型真正“跳得进”且“站得稳”的行为空间。
- Off-policy 的优势:它能强行把模型拉入它从未探索过的“世外桃源”(高价值状态空间),从而实现 Support Expansion。
- On-policy 的必要性:由于“暴露偏差(Exposure Mismatch)”,模型在实际推理时会进入训练数据从未覆盖的中间状态。只有 On-policy 方法能直接在模型自己的“犯错现场”进行 Policy Reshaping。
混合流水线 (Hybrid Pipelines) 的合纵连横
文章对比了当前最强的闭源/开源模型采用的阶段策略。典型的成功路径通常遵循:
- SFT:提供早期的有效支持(让模型先学会说话和基本逻辑)。
- RLHF/RLVR:进行同策修正(解决长程推理中的偏离问题)。
- Distillation:进行行为整合(将复杂教师模型的推理能力或搜索能力固化到学生模型中)。
(上图展示了 SFT, DPO, RLVR 等方法在溯源、接口和角色上的本质区别)
深度洞察:未来研究的 3 个方向
- 从万金油 SFT 转向模型感知监督:不要再喂给模型它已经学会的东西,要针对它的“分布缺口”补课。
- 行为整合的科学化:如何量化“阶段转换损耗”?为什么有的模型在 DPO 之后突然丧失了某些常识?
- 引导式同策学习:纯粹的随机采样(Exploration)太低效,未来的强化学习需要更强的中途“提示(Hinting)”或模板引导。
总结
这篇综述不仅仅是论文的罗列,它为 LLM 开发者提供了一套诊断工具。当你发现模型推理不理想时,你应该问自己:是因为正确答案在它的有效支持空间之外(需要更多优质 Off-policy 数据)?还是因为它在选择分支时选错了(需要更多 On-policy RL 训练)?
后训练不再是黑盒魔法,而是对模型行为概率版图的精密重绘。
