[Tsinghua] 无监督 RLVR 的天花板在哪里?深度解析 LLM 自我进化的“锐化陷阱”
How Far Can Unsupervised RLVR Scale LLM Training?
本文系统研究了无监督可验证奖励强化学习 (URLVR) 的扩展潜力,提出了 TTRL 等方法的统一理论框架。研究发现,基于模型内在信号的奖励(Intrinsic Rewards)本质上是一种“分布锐化”机制,虽能在小规模或测试时训练中取得 SOTA 增益,但在大规模训练中不可避免会走向模型崩溃。
TL;DR
大模型的自我进化(Self-Improvement)是通往 AGI 的必经之路。清华大学等团队的最新力作《How Far Can Unsupervised RLVR Scale LLM Training?》为火热的“无监督强化学习”泼了一盆冷水:研究证明,单纯依赖模型内在信号(如信心、投票一致性)的强化学习本质上只是在**锐化(Sharpening)**模型已有的先验知识。如果初始先验是错的,RL 只是在更坚定地“一本正经胡说八道”。
背景定位:从 DeepSeek-R1 的繁荣看“监督瓶颈”
当前的 SOTA 模型(如 DeepSeek-R1, Qwen3 系列)通过强化学习(RLVR)在数学和代码领域取得了跨越式进步。但问题在于:监督信号(Ground Truth)是稀缺的。当 AI 达到人类巅峰水平时,谁来为它提供正确答案?这催生了 Unsupervised RLVR (URLVR) —— 让模型“左右互搏”,自己给自己打分。
核心 Insight:内在奖励的“锐化”本质
作者提供了一个逻辑严密的数学证明(详见论文 Theorem 1):无论你使用的是**基于确信度(Certainty-Based)的奖励(如最小化熵),还是基于群体智慧(Ensemble-Based)**的奖励(如多数投票),这些内在奖励 (Intrinsic Rewards) 最终都会让模型收敛到其初始分布的一个锐化版本。
图 1:URLVR 分类学:内在奖励 vs 外部奖励
为什么内在奖励会失效?
- 马太效应:模型会不断加强它最初选中的那个答案(无论对错)。
- 奖励作弊 (Reward Hacking):模型为了降低熵(增加确信度),会学会一些“奇技淫巧”,比如通过无限重复、极度缩短回答来刷分,而非提升推理逻辑。
实验发现:先攀升,后崩溃 (The Rise and Fall)
研究者在 Qwen3 和 Llama 系列模型上进行了详尽实验。所有内在奖励方法都呈现出惊人的相似曲线:初期性能提升(压榨已有知识),随后奖励精度断崖式下跌,走向崩溃。
图 2:多数投票训练与 Ground-Truth 训练的动态对比,可见内在奖励的后期背离
崩溃的变体:
- 长度崩溃:基于概率乘积的方法倾向于生成极短的回答。
- 重复崩溃:基于熵的方法通过不断重复关键词来降低不确定性。
深度洞察:什么时候内在 RL 是安全的?
既然大规律是崩溃,为什么 TTRL 等方法在实际应用中还有用?作者给出了两点关键建议:
- 小数据集是避风港:当训练集极小(如 ≤128 个样本)时,模型只会发生“局部过拟合”,而不会导致全局策略崩溃。这使得 Test-Time Training (TTT) 成为内在奖励的最佳舞台。
- 迁移增益:即便在错题上训练,锐化过程也可能强化某种通用的推理模式,从而在 OOD(分布外)的题目上产生正确反馈。
进阶技巧:Model Collapse Step —— 筛选基座的新标准
如何判断一个基座模型是否适合做 RL?传统的 Pass@k 并不完全准确。作者提出 Model Collapse Step:观察该模型在无监督 RL 下能撑多久才崩溃。撑得越久,说明其“信心与正确率”的对齐程度越高。这一指标比运行完整的有监督 RL 快 5.6 倍。
未来之路:外部奖励是唯一的解药
为了跳出“锐化陷阱”,研究者探索了外部奖励 (External Rewards)。
- 生成-验证不对称性:例如 Countdown 任务(24 点游戏),写出表达式很难,但校验结果是否等于目标值却极其简单且准确。
- 结果证明:利用这种外部客观规律(如编译器、数学证明器)作为奖励,Reward Accuracy 在初期波动后会稳步回升。这证明了只有引入外部的、独立的“真理性约束”,LLM 训练才能真正突破自身的知识边界。
图 3:自验证(外部奖励)与轨迹熵(内在奖励)的性能对比
总结
内在奖励就像是“闭门造车”,适合在临考前针对特定题目(TTT)抱佛脚;而要真正培养出“超级智能”,必须让模型走出去,在代码执行、形式化证明、科学模拟等具备客观校验机制的领域进行外部强化学习。
