[CVPR 2025候选] VG3S:几何扎根的高斯泼溅,开启 3D 占据预测新范式

VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction

总结
问题
方法
结果
要点
摘要

本文提出了 VG3S,一种利用视觉基础模型 (VFM) 的跨视图几何扎根能力来增强 3D 语义占据预测的框架。通过将预训练且冻结的 VFM(如 VGGT)生成的几何先验注入基于高斯泼溅 (Gaussian Splatting) 的解码器,该方法在 nuScenes 榜单上取得了 IoU 提升 12.6% 和 mIoU 提升 7.5% 的显著成果。

TL;DR

在自动驾驶 3D 感知领域,语义占据预测 (Semantic Occupancy Prediction) 正在从体素 (Voxel) 转向更高效的 3D 高斯泼溅 (3DGS)。本文提出的 VG3S 框架,通过引入 视觉基础模型 (VFM) 的强大几何先验,解决了纯视觉占据预测中常见的“几何破碎”问题。在 nuScenes 榜单上,它将 IoU 提升了 12.6%,为构建统一且一致的 3D 驾驶环境理解提供了新思路。

背景定位:从 Voxel 到 Gaussian 的跨越

传统的占据预测通常依赖离散化的体素或 BEV 表征,但这种方法在处理大规模室外场景时计算冗余极高。近期出现的基于高斯的场景建模(如 GaussianFormer)通过空间稀疏性大幅提升了效率,但它们依然面临一个致命痛点:几何一致性差。

由于缺乏显式的几何约束,现有的模型在面对多视角图像时,往往无法拼凑出一个完整的“世界模型”,导致路面断裂、电线杆消失。VG3S 的核心直觉在于:既然从零学习 3D 几何很难,为什么不直接利用已经在大规模 3D 数据上预训练好的 VFM 模型(如 VGGT)呢?

痛点深挖:为何基础模型无法“直接使用”?

虽说 VFM 蕴含丰富的几何知识,但将其直接插入占据预测框架存在三大挑战:

  1. 冗余性:基础模型的各层 Token 包含大量通用的语义信息,并非所有都对占据预测有用。
  2. 任务错位:基础模型的表征是在通用流形空间,而占据预测需要具有高度空间辨识度的视觉特征。
  3. 计算成本:全量微调 VFM 会导致灾难性遗忘并消耗海量算力。

核心贡献:分层几何特征适配器 (HGFA)

为了优雅地解决上述问题,VG3S 提出了 HGFA,这是一个无需微调 VFM 主干网络、仅通过侧边分支进行特征注入的插拔式模块。

模型架构图

1. 分组自适应 Token 融合 (GATF)

模型将 VFM 的不同层进行分组。通过一个自适应加权网络,它能够动态抑制层内冗余的几何响应,只保留最具信息量的场景特征。

2. 任务对齐 Token 精炼 (TATR)

利用轻量级的残差模块对 Token 进行校准,过滤掉与 3D 占据无关的背景噪声。

3. 潜空间特征金字塔 (LSFP)

这是最关键的一步。它将一维 Token 重新映射回二维空间,并通过深度卷积 (DW-Conv) 和 Squeeze-and-Excitation (SE) 机制强制执行局部几何一致性,最后构建出多尺度的特征金字塔。

实验战绩:全方位领先

在 nuScenes 占据预测评估中,VG3S 展示了统治级的表现:

实验结果对比

  • 性能飞跃:在 SC IoU 这一衡量几何完整性的关键指标上,VG3S 达到了 34.41%,远超基线 GaussianFormer-2 的 30.56%。
  • 类别表现:在“Manmade”(人工建筑)和“Drivable Surface”(路面)等类别的提升尤为明显(分别提升至 17.46% 和 42.42%),这直接证明了 VFM 带来的几何一致性确实起到了“补全”作用。
  • 通用性:实验显示,VG3S 可以无缝适配包括 DINOv3、DVGT、DGGT 在内的多种 VFM,具有极强的鲁棒性。

可视化分析:几何连续性的回归

从原文提供的对比图可以清晰看到,基线方法产生的路面充满了“空洞”,而 VG3S 输出的语义占据结果更加平滑、连续。

需替换为架构图

总结与洞察

VG3S 的成功不仅在于它刷高了分数,更在于它确立了一个范式:将几何感知型 VFM 作为冻结的特征提取器,通过精巧的适配器进行 2D 到 3D 的知识转移。

局限性:虽然精度提升显著,但多尺度特征金字塔的引入不可避免地增加了一定的推理延迟。在极其追求实时的自动驾驶车载平台上,如何进一步量化或蒸馏这些 VFM 特征将是未来的关键研究方向。

未来展望:随着 VFM(如 DINOv3)能力的持续进化,这种“大模型当骨干,轻量化适配当下游”的模式很可能成为未来 3D 自动驾驶感知的标准架构。

发现相似论文

试试这些示例

  • 查找最近其他利用视觉基础模型 (VFMs) 的中间层特征来增强自动驾驶 3D 感知(如占据预测或深度估计)的论文。
  • 哪篇论文最早提出了 VGGT (Visual Geometry Grounded Transformer),VG3S 是如何通过分层适配器改进其原始 Token 输出的?
  • 有哪些研究将 3D 高斯泼溅 (3D Gaussian Splatting) 应用于动态自动驾驶场景的实时语义制图或在线建图任务中?
目录
[CVPR 2025候选] VG3S:几何扎根的高斯泼溅,开启 3D 占据预测新范式
1. TL;DR
2. 背景定位:从 Voxel 到 Gaussian 的跨越
3. 痛点深挖:为何基础模型无法“直接使用”?
4. 核心贡献:分层几何特征适配器 (HGFA)
4.1. 1. 分组自适应 Token 融合 (GATF)
4.2. 2. 任务对齐 Token 精炼 (TATR)
4.3. 3. 潜空间特征金字塔 (LSFP)
5. 实验战绩:全方位领先
6. 可视化分析:几何连续性的回归
7. 总结与洞察