[ICLR 2025] RCRL:让强化学习更“听话”,实现 Zero-shot 行为操控与性能跨越

Reward-Conditioned Reinforcement Learning

总结
问题
方法
结果
要点
摘要

本文提出了 Reward-Conditioned Reinforcement Learning (RCRL),一种通过在训练时将策略和价值函数参数化并以奖励函数为条件(Conditioning)的强化学习框架。该方法在单任务数据采集的前提下,通过 Off-policy 学习多种反事实奖励目标,实现了在单任务、多任务及视觉基准测试中 SOTA 性能的提升。

TL;DR

传统的强化学习(RL)智能体通常是“死脑筋”:一旦奖励函数定义好,它们就只会朝着那一个方向优化。本文提出的 Reward-Conditioned Reinforcement Learning (RCRL) 框架彻底打破了这一局限。它通过在训练中引入多样化的奖励参数化方案作为输入条件,使单个策略能够理解“奖励如何影响行为”。结果显示,RCRL 不仅在标称任务上刷写了 SOTA,还实现了惊人的 Zero-shot 行为操控 和极速的任务迁移。

痛点深挖:奖励规格的脆弱性

在现实的机器人探测或自动驾驶场景中,我们很难一次性定义出完美的奖励函数。通常,奖励是由多个组件(如速度、平滑度、能耗)加权构成的。一旦我们想要机器人跑得更稳一点或省电一点(即调整权重 ),现有的策略往往会失效,必须从头训练。这种不可操纵性(Non-steerability)和重训高成本严重阻碍了 RL 的落地。

核心方法:奖励即条件 (Reward as a Condition)

RCRL 的核心直觉非常直观:既然奖励函数是由参数 决定的,为什么不把 直接告诉模型呢?

1. 架构解析

RCRL 将策略 和价值函数 参数化,使其以当前奖励的配置为条件。

  • 交互阶段:智能体仍然按照预设的“标称奖励” 进行环境交互,确保存储在 Replay Buffer 中的数据质量。
  • 训练阶段:模型不只学习 。对于 Batch 中的每一条数据,RCRL 以 50% 的概率随机采样其他的奖励参数 (通过扰动或引入辅助目标),计算反事实收益进行 Off-policy 更新。

RCRL 框架总览 图 1:RCRL 机制:(A) 标称环境下采集数据;(B) 训练时随机采样奖励参数;(C) 拼接到状态中输入网络

2. 构建奖励池

作者提出了两种策略来让模型见多识广:

  • 参数化扰动 (Parameterized Conditioning):对标称权重的每一项进行乘性扰动,生成一系列“变体任务”。
  • 辅助任务条件 (Auxiliary Task Conditioning):利用同一机器人实体的不同任务(如同时学习走、跑、站立的奖励函数),即便是在跑的数据上也能学到如何站立。

实验战绩:性能与灵活性的双赢

1. 标称性能的“免费午餐”

令人惊讶的是,即使最终只在标称奖励下评估,RCRL 的表现也远优于传统方法。在 Meta-task 基准测试中,RCRL 显著提升了学习速度。这说明这种“奖励增强”起到了极佳的正则化作用,帮助模型学到了更具泛化性的特征表示。

实验结果对比 图 2:在单任务(上)和多任务(下)设置中,RCRL 均显著提升了样本效率

2. Zero-shot 操控:指哪打哪

这是本篇工作最“性感”的部分。训练完成后,我们只需改变输入的 ,就能在不更新任何参数的情况下,让同一套策略调节运行速度、站立高度。

  • Cheetah 实验:通过调节奖励中速度项的 Target,模型能够精准地在 0 到 12m/s 之间切换速度。
  • Humanoid 实验:调节动作惩罚项,模型会自发产生从“激进”到“优雅”的行为转变。

Zero-shot 行为调节可视化 图 3:Zero-shot 表现:无需重训,仅通过改变输入 即可精准控制机器人行为指标

深度洞察:为什么它有效?

RCRL 的本质是利用了 Inductive Bias 的一种特殊形式。它并不是简单地让模型对奖励变化不敏感(Domain Randomization),而是让模型学习到 奖励-状态-行为 的因果映射。这种做法在保持单任务采集简单性的同时,获得了类似多任务学习的表征能力。

总结与展望

RCRL 的成功启示我们:奖励函数不应仅是黑盒的反馈信号,它本身就是携带任务结构信息的高维特征。

局限性:目前的 RCRL 严重依赖于 Off-policy 数据的质量。如果标称策略采集的数据分布(State-action Coverage)太窄,模型很难在完全不探索的情况下学到极端奖励下的行为。未来的研究方向可能在于如何根据当前的 Buffer 分布动态生成“能够被有效学习”的辅助奖励函数。


关键词:Off-policy RL, Reward Conditioning, Zero-shot Transfer, Steerable Policies.

发现相似论文

试试这些示例

  • 查找最近其他利用反事实数据进行奖励重标记(Reward Relabeling)以增强策略鲁棒性的强化学习论文。
  • 哪篇论文最早系统性地定义了目标条件强化学习 (GCRL) 框架,RCRL 在其基础上对密集组合评价函数的处理有何创新?
  • 有哪些研究探讨了将奖励参数化条件(Reward Conditioning)应用到大语言模型 RLHF 阶段以实现多偏好对齐?
目录
[ICLR 2025] RCRL:让强化学习更“听话”,实现 Zero-shot 行为操控与性能跨越
1. TL;DR
2. 痛点深挖:奖励规格的脆弱性
3. 核心方法:奖励即条件 (Reward as a Condition)
3.1. 1. 架构解析
3.2. 2. 构建奖励池 $\Psi$
4. 实验战绩:性能与灵活性的双赢
4.1. 1. 标称性能的“免费午餐”
4.2. 2. Zero-shot 操控:指哪打哪
5. 深度洞察:为什么它有效?
6. 总结与展望