[Tsinghua] 无监督 RLVR 的天花板在哪里?深度解析 LLM 自我进化的“锐化陷阱”

How Far Can Unsupervised RLVR Scale LLM Training?

总结
问题
方法
结果
要点
摘要

本文系统研究了无监督可验证奖励强化学习 (URLVR) 的扩展潜力,提出了 TTRL 等方法的统一理论框架。研究发现,基于模型内在信号的奖励(Intrinsic Rewards)本质上是一种“分布锐化”机制,虽能在小规模或测试时训练中取得 SOTA 增益,但在大规模训练中不可避免会走向模型崩溃。

TL;DR

大模型的自我进化(Self-Improvement)是通往 AGI 的必经之路。清华大学等团队的最新力作《How Far Can Unsupervised RLVR Scale LLM Training?》为火热的“无监督强化学习”泼了一盆冷水:研究证明,单纯依赖模型内在信号(如信心、投票一致性)的强化学习本质上只是在**锐化(Sharpening)**模型已有的先验知识。如果初始先验是错的,RL 只是在更坚定地“一本正经胡说八道”。

背景定位:从 DeepSeek-R1 的繁荣看“监督瓶颈”

当前的 SOTA 模型(如 DeepSeek-R1, Qwen3 系列)通过强化学习(RLVR)在数学和代码领域取得了跨越式进步。但问题在于:监督信号(Ground Truth)是稀缺的。当 AI 达到人类巅峰水平时,谁来为它提供正确答案?这催生了 Unsupervised RLVR (URLVR) —— 让模型“左右互搏”,自己给自己打分。

核心 Insight:内在奖励的“锐化”本质

作者提供了一个逻辑严密的数学证明(详见论文 Theorem 1):无论你使用的是**基于确信度(Certainty-Based)的奖励(如最小化熵),还是基于群体智慧(Ensemble-Based)**的奖励(如多数投票),这些内在奖励 (Intrinsic Rewards) 最终都会让模型收敛到其初始分布的一个锐化版本。

模型架构图 图 1:URLVR 分类学:内在奖励 vs 外部奖励

为什么内在奖励会失效?

  1. 马太效应:模型会不断加强它最初选中的那个答案(无论对错)。
  2. 奖励作弊 (Reward Hacking):模型为了降低熵(增加确信度),会学会一些“奇技淫巧”,比如通过无限重复、极度缩短回答来刷分,而非提升推理逻辑。

实验发现:先攀升,后崩溃 (The Rise and Fall)

研究者在 Qwen3 和 Llama 系列模型上进行了详尽实验。所有内在奖励方法都呈现出惊人的相似曲线:初期性能提升(压榨已有知识),随后奖励精度断崖式下跌,走向崩溃。

实验结果对比 图 2:多数投票训练与 Ground-Truth 训练的动态对比,可见内在奖励的后期背离

崩溃的变体:

  • 长度崩溃:基于概率乘积的方法倾向于生成极短的回答。
  • 重复崩溃:基于熵的方法通过不断重复关键词来降低不确定性。

深度洞察:什么时候内在 RL 是安全的?

既然大规律是崩溃,为什么 TTRL 等方法在实际应用中还有用?作者给出了两点关键建议:

  1. 小数据集是避风港:当训练集极小(如 ≤128 个样本)时,模型只会发生“局部过拟合”,而不会导致全局策略崩溃。这使得 Test-Time Training (TTT) 成为内在奖励的最佳舞台。
  2. 迁移增益:即便在错题上训练,锐化过程也可能强化某种通用的推理模式,从而在 OOD(分布外)的题目上产生正确反馈。

进阶技巧:Model Collapse Step —— 筛选基座的新标准

如何判断一个基座模型是否适合做 RL?传统的 Pass@k 并不完全准确。作者提出 Model Collapse Step:观察该模型在无监督 RL 下能撑多久才崩溃。撑得越久,说明其“信心与正确率”的对齐程度越高。这一指标比运行完整的有监督 RL 快 5.6 倍。

未来之路:外部奖励是唯一的解药

为了跳出“锐化陷阱”,研究者探索了外部奖励 (External Rewards)。

  • 生成-验证不对称性:例如 Countdown 任务(24 点游戏),写出表达式很难,但校验结果是否等于目标值却极其简单且准确。
  • 结果证明:利用这种外部客观规律(如编译器、数学证明器)作为奖励,Reward Accuracy 在初期波动后会稳步回升。这证明了只有引入外部的、独立的“真理性约束”,LLM 训练才能真正突破自身的知识边界。

实验结果对比 图 3:自验证(外部奖励)与轨迹熵(内在奖励)的性能对比

总结

内在奖励就像是“闭门造车”,适合在临考前针对特定题目(TTT)抱佛脚;而要真正培养出“超级智能”,必须让模型走出去,在代码执行、形式化证明、科学模拟等具备客观校验机制的领域进行外部强化学习。

发现相似论文

试试这些示例

  • 查找最近一年内利用生成-验证不对称性(Generation-Verification Asymmetry)实现大语言模型自我进化的论文。
  • 哪篇论文最早系统性地探讨了 RLHF 中的 Reward Hacking 导致模型性能退化的数学机理,本文的“锐化理论”与其有何关联?
  • 调研除了数学和代码领域,在法律或医疗社交等非结构化领域实现可验证奖励(Verifiable Rewards)的最新方法。
目录
[Tsinghua] 无监督 RLVR 的天花板在哪里?深度解析 LLM 自我进化的“锐化陷阱”
1. TL;DR
2. 背景定位:从 DeepSeek-R1 的繁荣看“监督瓶颈”
3. 核心 Insight:内在奖励的“锐化”本质
3.1. 为什么内在奖励会失效?
4. 实验发现:先攀升,后崩溃 (The Rise and Fall)
4.1. 崩溃的变体:
5. 深度洞察:什么时候内在 RL 是安全的?
6. 进阶技巧:Model Collapse Step —— 筛选基座的新标准
7. 未来之路:外部奖励是唯一的解药
8. 总结