[CVPR 2026] LPS:无需调参的潜在策略引导,让离线强化学习走向真实世界

Latent Policy Steering through One-Step Flow Policies

总结
问题
方法
结果
要点
摘要

本文提出了 Latent Policy Steering (LPS),一种用于离线强化学习(Offline RL)的鲁棒架构。该方法通过将动作空间 Critic 的梯度直接反向传播至可微的一步生成模型(MeanFlow),在潜在空间内实现策略优化,显著提升了机器人在复杂任务中的操作成功率与推理速度。

TL;DR

离线强化学习(Offline RL)在机器人领域极具潜力,但其性能往往受制于行为约束(Behavioral Constraints)与奖励最大化之间微妙的平衡。本文提出的 Latent Policy Steering (LPS) 摒弃了复杂的 α 参数调优,通过 MeanFlow 一步生成模型 建立可微的桥梁,直接将动作空间的价值梯度引导至潜在空间,实现了高性能、高鲁棒性的机器人策略提取。

  • 核心定位:SOTA 刷榜级工作,解决了离线 RL 在现实部署中“调参难”的工程痛点。

痛点深挖:α 调优的“炼丹”困局

在传统的离线 RL(如 TD3+BC)中,我们需要设置一个权重系数 :

  • 过大:模型退化为简单的行为克隆(BC),无法超越数据集中的表现。
  • 过小:模型会生成 OOD(分布外)动作,导致 Q 函数估计爆炸。

如下图所示,在不同任务中,最优的 范围极窄且互不通用,这对现实世界中的机器人训练几乎是灾难性的。

正则化权重敏感性实验 图 1:FQL 算法对 α 的极高敏感性,不同值的采样分布差异巨大。


核心方法:LPS 的三项核心设计

1. 结构化解耦与一步引导

LPS 的核心直觉是:让生成模型负责“安全边界”,让 Latent Actor 负责“追求高分”。 作者选用了 MeanFlow。不同于需要多次迭代(Iterative Denoising)的 Diffusion 模型,MeanFlow 提供了一个一步到位且完全可微的映射过程: 这意味着 Critic 的梯度 ∇aQ 可以直接、无损地顺着这个映射传给潜变量 。

2. 球形潜在几何 (Spherical Latent Geometry)

在优化潜变量 时,容易出现“模长爆炸”(Norm Explosion)。LPS 利用高维高斯的统计特性,将潜在空间约束在 超球体 (Hypersphere) 上。这种同步设计确保了 Latent Actor 输出的每一个点,都在 MeanFlow 先验的有效覆盖范围内。

3. 直接反向传播 (No-Proxy Optimization)

早期的潜在引导方法(如 DSRL)需要先训练一个“潜在 Critic” ,但这会引入巨大的近似误差。LPS 则是直接联通:

LPS 架构图 图 2:LPS(底部)与传统方法(顶部/中部)对比。LPS 消除了代理 Critic,直接通过可微路径优化。


实验战绩:从仿真到真机

OGBench 性能标杆

在 25 个基于状态的操作任务和 5 个像素级任务中,LPS 展现了极强的统治力。即便不进行任务特定的调参,它的成功率依然稳居 SOTA。

OGBench 成功率对比 图 3:在 OGBench 多个复杂任务上的成功率对比。

真实机器人:修正“人类的失误”

在 DROID 平台上的实验非常有趣:人类遥操作的数据集往往包含犹豫、抖动等冗余动作。纯 BC 方法会完美复现这些缺点。而 LPS 能够精准识别并“修正”这些犹豫,在灯泡插入、胶带填充等高精度任务中表现远超 BC。

真实世界任务 图 4:真实世界机器人操作任务展示。


深度总结:通向鲁棒机器人学习之路

LPS 的本质提升在于: 它将 RL 的复杂优化难题,通过几何约束和数学建模转化为了一个结构化的搜索问题。它的成功告诉我们,与其在大规模参数中苦苦寻找那个平衡点(α),不如建立一个物理上连贯、数学上可微的机制。

局限性: LPS 的上限依然取决于“底座模型”(MeanFlow Base Policy)的质量。如果基础数据中完全缺失了某种模态,潜在引导也无法无中生有。

展望: 随着 VLA(视觉-语言-动作)模型的兴起,如何在大规模预训练模型上应用 LPS 这种“精准引导”技术,减少对昂贵在线交互的依赖,将是未来的核心战场。


Senior Editor's Note: 这是一篇兼具工程实用性与数学美感的工作。它对 MeanFlow 的重塑和对球形空间的利用,对于任何从事高维度生成策略研究的开发者都有极强的参考价值。

发现相似论文

试试这些示例

  • 查找并对比 2024-2025 年间其他试图解决离线强化学习中超参数 α 敏感性问题的论文。
  • MeanFlow 算法最早是在哪篇论文中提出的,LPS 对其“噪声到动作”(Noise-to-action)的重新表述有哪些具体改进?
  • 目前有哪些研究正在将单步生成策略(One-step Generative Policies)应用到大规模视觉-语言-动作(VLA)模型中?
目录
[CVPR 2026] LPS:无需调参的潜在策略引导,让离线强化学习走向真实世界
1. TL;DR
2. 痛点深挖:α 调优的“炼丹”困局
3. 核心方法:LPS 的三项核心设计
3.1. 1. 结构化解耦与一步引导
3.2. 2. 球形潜在几何 (Spherical Latent Geometry)
3.3. 3. 直接反向传播 (No-Proxy Optimization)
4. 实验战绩:从仿真到真机
4.1. OGBench 性能标杆
4.2. 真实机器人:修正“人类的失误”
5. 深度总结:通向鲁棒机器人学习之路