[arXiv 2026] PROSPECT:统一流式导航智能体,空间-语义融合与潜空间预测的深度结合
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
PROSPECT 提出了一种统一的流式视觉语言导航 (VLN) 框架,通过结合流式视觉语言动作 (VLA) 策略与潜在预测表示学习(Latent Predictive Representation)来实现稳健导航。该方法引入 CUT3R 作为 3D 空间编码器,并在 VLN-CE 基准测试上取得了 SOTA 成就,同时在真实机器人部署中展现了极强的环境鲁棒性。
TL;DR
在视觉语言导航(VLN)领域,由于缺乏对 3D 空间的物理直觉以及对未来状态的预测能力,智能体往往在复杂或长程任务中“迷路”。本文提出的 PROSPECT 通过引入 CUT3R 流式 3D 编码器和基于 JEPA 灵感的潜空间预测分支,构建了一个既懂语义又懂空间的“有远见”的导航员。它在不增加推理成本的前提下,通过训练时的预测任务极大增强了表示的稳健性。
1. 痛点深挖:为什么现有的 VLN 模型“近视”且“空间感差”?
目前的 Vision-Language-Action (VLA) 模型虽然能通过大语言模型(LLM)理解指令,但面临两大挑战:
- 空间缺失:仅依赖 2D 图像特征(如 SigLIP/CLIP),模型很难理解物体的绝对尺度和三维布局,尤其是在视角大幅度切换时。
- 预测瓶颈:现有的世界模型往往试图预测“下一帧长什么样”(像素预测),这会引入大量无关噪声(如光影变化、壁纸纹理),导致模型在未见过场景中极易过拟合。
2. Methodology:PROSPECT 的核心架构
PROSPECT 的核心设计理念是:在潜空间中预见未来。
2.1 2D-3D 融合感知
PROSPECT 不同于以往使用 VGGT(相对尺度且内存开销大)的方法,它采用了 CUT3R。这是一个原生支持流式的 3D 基础模型,能产生具有绝对尺度(Absolute-scale)的空间特征。通过 Cross-Attention 机制,模型将 SigLIP 的语义信息与 CUT3R 的几何信息交织,为 LLM 提供全方位的环境感知。

2.2 流式查询 Token 与潜空间预测
这是本文最精彩的部分。作者在 LLM 序列末尾插入了 ⟨q2D⟩ 和 ⟨q3D⟩ 两个 learnable tokens。
- 作用:这些 Token 通过 LLM 内部的注意力机制“反向查询”历史上下文。
- 监督:它们的目标不是预测图像,而是预测下一时刻由 Teacher Models(冻结的 SigLIP 和 CUT3R)提取的特征向量。
- 因果掩码设计:作者设计了一种特殊的流式注意力掩码(Streaming Attention Mask),确保预测 Token 只能访问过去的信息,且 2D 和 3D 预测任务互不干扰。
3. 实验验证:长程任务与极端光照下的统治力
实验在 VLN-CE 的 R2R 和 RxR 数据集上展开。结果显示,任务越长(RxR),PROSPECT 的优势越明显。

- 长程增益:在步骤超过 100 步的场景中,PROSPECT 的成功率提升了 4.14%。
- 消融实验:结果证明(见下表),同时加入 2D 语义预测和 3D 空间预测能产生 1+1>2 的效果,显著降低导航误差(NE)。

4. 真实机器人部署:从实验室走向黑夜
PROSPECT 在 ARX-Lift2 机器人上进行了实测。最令人印象深刻的是其在**户外夜间(Night Street)**的表现。由于预测分支迫使模型学习底层的几何和动态逻辑,而非表面像素,它对低光照和动态阴影具有天然的免疫力。

5. 深度洞察与总结
Takeaway:PROSPECT 的成功验证了 JEPA(联合嵌入预测架构) 在具身导航领域的巨大潜力。通过在潜空间进行预测,智能体获得了一种“物理直觉”。
局限性:尽管在训练中引入了预测任务,但目前的预测仅限于下一时刻(One-step lookahead)。如果未来能实现多步(Multi-step)潜空间想象,智能体的避障和路径规划能力可能会进一步发生质变。
PROSPECT 为我们展示了未来流式 Embodied VLA 的标准范式:强感知的 3D 表征 + 隐式的世界模型模拟。
