[CVPR 2025] Curious-VLA:打破“狭隘策略”魔咒,释放自动驾驶大模型的探索潜力
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
本文提出了 Curious-VLA,一个通过两阶段设计解决自动驾驶 VLA 模型“狭隘策略 (Narrow Policy)”问题的训练框架。该方法在 Navsim 榜单上取得了 90.3 PDMS 的 SOTA 战绩,并在 Best-of-N 评测中达到 94.8,比肩人类驾驶水平。
TL;DR
在自动驾驶 VLA(Vision-Language-Action)领域,主流的“模仿学习 (IL) + 强化学习 (RL)”流水线正面临一个冷酷的现实:模型学得太“死”了。本文识别出了这一核心痛点——狭隘策略 (Narrow Policy, NP)。通过在 IL 阶段进行可行轨迹扩展(FTE)和在 RL 阶段引入多样性感知采样(ADAS),Curious-VLA 不仅在 Navsim 榜单上刷新了 SOTA,更在探索能力上实现了质的飞跃。
痛点深挖:为什么你的 VLA 模型拒绝“探索”?
传统的两阶段训练(SFT -> RL)在驾驶任务中表现出极强的探索塌缩。作者指出,模仿学习(IL)通常使用交叉熵损失强制模型拟合唯一的 Ground-truth (GT) 轨迹。
- 目标错配:CE Loss 将所有非 GT 的 Token 视为同等错误,忽略了物理空间上的邻近性。
- 物理尺度不匹配:远界(Far-horizon)的坐标方差远大于近界,导致模型忽略了决定转向精度的近场动作。
- 优势消失:在 RL 阶段,如果模型只会输出几种高度相似的轨迹,GRPO 等算法中的奖励标准差 会趋于 0,导致梯度消失,模型过早停止进化。
图 1:基线模型 Qwen2.5-VL 即使进行多次采样,其轨迹也高度重叠(左),而 Curious-VLA 展现出丰富的探索行为(右)。
方法论详解:Curious-VLA 的“破壁”三部曲
1. 模仿阶段:可行轨迹扩展 (FTE)
作者不认为 GT 是唯一的标准。他们利用基于扩散模型的 Planner 生成大量物理可行且安全的替代轨迹(共 142k 个样本)。
- 步进式归一化 (Step-wise Normalization):针对不同时间步的坐标分布进行独立归一化,解决了远近界梯度量级不平衡的问题,让模型对每一个动作细节都“同等重视”。
2. 模型架构:结构化 Chain-of-Thought
模型不仅输出坐标,更要经历:感知关键目标 -> 驾驶合理解释 -> 元行为描述 -> 轨迹预测。这种结构化的思考过程提升了决策的可解释性与逻辑一致性。
图 2:Curious-VLA 整体流程,涵盖了 IL 阶段的数据增强与 RL 阶段的采样优化。
3. 强化阶段:多样性感知采样 (ADAS)
并不是所有场景都值得 RL。ADAS 策略会预先过滤掉那些无论怎么采样结果都一样的“简单场景”,优先选择那些在 Bernoulli 测试中表现出高方差(即模型还在犹豫、有提升空间)的挑战性场景进行训练。 同时,跨度驾驶奖励 (SDR) 借鉴了 Focal Loss 的思想,放大小缺陷与完美驾驶之间的奖励跨度,让模型对“好”与“更好”更敏感。
实验与结果:比肩人类的安全感
在 Navsim 这一严苛的非反应式仿真评测中,Curious-VLA 表现惊人:
- PDMS 评分:达到 90.3,超过了包括 UniAD, DiffusionDrive 在内的众多强力基线。
- Best-of-N (N=6):得分高达 94.8,这已经完全达到了人类真值的水平。这意味着在多种备选方案中,模型总能找到一条接近完美的路径。
表 1:Curious-VLA 在 Navsim v1 上的主实验结果,各子项指标表现均衡。
行为诊断 (Behavioral Diagnostics)
为了量化 NP 问题的改善,作者对比了轨迹多样性。结果显示,加入 FTE 和 RL 后,模型的平均成对终点误差 (mean-pFDE) 从 0.20 提升到了 1.41,证明了模型真正学到了“条条大路通罗马”,而不是死磕一条线。
深度洞察与总结
Curious-VLA 的成功揭示了一个深刻的直觉:自动驾驶的本质是处理不确定性。如果模型在训练初期就被困在单一的“专家经验”中,它就无法学会在复杂路况下进行博弈与权衡。
局限性:尽管 PDMS 指标很高,但在舒适度(Comfort)指标上相比基线略有牺牲,这反映了强制探索可能带来的驾驶激进性。未来的工作需要进一步平衡平衡“好奇心”与“平顺性”之间的矛盾。
启示:对于追求端到端驾驶的研究者来说,仅仅堆砌数据量是不够的,如何构建具有负样本感知和多模态分布的动作空间,才是通向 L4 的钥匙。
