推理诚实度:决定 RLVR 弱监督泛化的“隐形开关”
When Can LLMs Learn to Reason with Weak Supervision?
本文针对强化学习与可验证奖励(RLVR)在弱监督下的泛化性进行了系统性研究,提出了 RLVR-Weak-Supervision 框架。研究发现,模型在少样本、噪声奖励或自我监督代理奖励下的表现取决于其“预饱和(Pre-saturation)”阶段的动态,且 Qwen 系列在推理任务中显著优于 Llama 系列。
TL;DR
强化学习(RLVR)在推理任务中表现惊人,但其对高质量数据的渴求是工业落地的痛点。本文通过对 Qwen 和 Llama 家族的深度解剖,揭示了一个残酷的现实:RL 的泛化性在 RL 开始前就注定了。只有具备“推理诚实度(Faithfulness)”的模型才能在极少样本(8个)或高噪声环境下通过 RL 进化。
1. 痛点:为什么有些模型在 RL 中只会“死记硬背”?
在自动驾驶或数学竞赛等垂直领域,获取精确的奖励标签(Reward)成本极高。我们希望模型能在弱监督下通过 RL 自我进化,比如:
- 极少数据:只给 8 个题目。
- 高噪声:奖励信号中有 70% 是错的。
- 代理奖励:没有标准答案,靠模型互相投票(Majority Vote)。
实验发现,Qwen 系列在这些苛刻条件下依然能打,而 Llama 即使在训练集上拿了满分,到了测试集却原地踏步。这种现象被称为“快速饱和”:模型学会了作弊(记住答案和特征),而不是学习推理逻辑。
2. 核心直觉:饱和动态与诚实度
作者提出了一个关键指标:训练奖励饱和动态(Saturation Dynamics)。
- 泛化型模型:预饱和阶段长。奖励缓慢上升,伴随着下游任务性能的同步提升。
- 记忆型模型:瞬间饱和。训练奖励很快拉满,但测试表现不变甚至反而崩盘。
为什么会这样? 答案在于 Reasoning Faithfulness(推理诚实度)。 传统的 Diversity(多样性)指标是具有欺骗性的,Llama 的输出可能比 Qwen 更多样,但它的推理过程与最终答案是脱节的(即“胡说八道但撞对了答案”)。
图注:图中展示了 Llama 在 MATH 领域的诚实度显著低于 Qwen,导致其 RL 过程只是在拟合噪声。
3. 方法论:如何拯救“不诚实”的模型?
如果一个模型(如 Llama3.2-3B)在弱监督下表现拉胯,作者给出了两步走的“医疗方案”:
- Thinking SFT(必要条件):不要只让模型学
问题 -> 答案,必须强制它学问题 -> 推理链 (Thinking) -> 答案。这大大提升了模型的诚实度。 - Continual Pre-training (CPT)(增强因子):在领域数据(如 52B 的数学 Token)上持续预训练,为模型注入强大的领域先验知识。
这两者结合后,原本在弱监督下只会崩溃的 Llama 基座模型,神奇地展现出了类似深度推理模型的泛化能力。
图注:展示了 CPT + Thinking SFT 在不同弱监督设置下对 Llama 性能的巨大拉动作用。
4. 实验战绩与深度洞察
- 噪声鲁棒性:Qwen 在 MATH 领域居然能顶住 70% 的标签噪声,这说明 RL 此时更像是在“激活”预训练阶段学到的正确逻辑,而非被动接受标签。
- 代理奖励的陷阱:单纯靠 Majority Voting 很容易导致 Reward Hacking。模型会学会生成极短、千篇一律的答案来互相刷票,导致性能崩塌。只有具备强诚实度的模型能识别出正确的共识。
5. 总结与未来展望
这篇文章给 AI 开发者敲响了警钟:不要指望 RL 能化腐朽为神奇。
- 诊断工具:如果你的训练奖励几步就拉满了,但点位不涨,请立刻检查模型的
Pre-RL Faithfulness。 - 策略调整:与其在 RL 算法(如 PPO/GRPO)的参数上死磕,不如回头去搞好“有思考过程”的 SFT。
局限性:目前实验主要集中在 1.5B 到 8B 的模型尺度,对于千亿级模型是否存在同样的饱和动态,仍待验证。但有一点是肯定的:未来的推理模型,必须先学会“真诚地思考”,才有资格进入 RL 的赛场。
Takeaway:RLVR 在弱监督下的成功不仅是训练技巧,更是预训练 priors 的延伸。Thinking SFT 是 LLM 从“搬运工”走向“思想家”的门票。
