[CVPR 2025候选] VG3S:几何扎根的高斯泼溅,开启 3D 占据预测新范式
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
本文提出了 VG3S,一种利用视觉基础模型 (VFM) 的跨视图几何扎根能力来增强 3D 语义占据预测的框架。通过将预训练且冻结的 VFM(如 VGGT)生成的几何先验注入基于高斯泼溅 (Gaussian Splatting) 的解码器,该方法在 nuScenes 榜单上取得了 IoU 提升 12.6% 和 mIoU 提升 7.5% 的显著成果。
TL;DR
在自动驾驶 3D 感知领域,语义占据预测 (Semantic Occupancy Prediction) 正在从体素 (Voxel) 转向更高效的 3D 高斯泼溅 (3DGS)。本文提出的 VG3S 框架,通过引入 视觉基础模型 (VFM) 的强大几何先验,解决了纯视觉占据预测中常见的“几何破碎”问题。在 nuScenes 榜单上,它将 IoU 提升了 12.6%,为构建统一且一致的 3D 驾驶环境理解提供了新思路。
背景定位:从 Voxel 到 Gaussian 的跨越
传统的占据预测通常依赖离散化的体素或 BEV 表征,但这种方法在处理大规模室外场景时计算冗余极高。近期出现的基于高斯的场景建模(如 GaussianFormer)通过空间稀疏性大幅提升了效率,但它们依然面临一个致命痛点:几何一致性差。
由于缺乏显式的几何约束,现有的模型在面对多视角图像时,往往无法拼凑出一个完整的“世界模型”,导致路面断裂、电线杆消失。VG3S 的核心直觉在于:既然从零学习 3D 几何很难,为什么不直接利用已经在大规模 3D 数据上预训练好的 VFM 模型(如 VGGT)呢?
痛点深挖:为何基础模型无法“直接使用”?
虽说 VFM 蕴含丰富的几何知识,但将其直接插入占据预测框架存在三大挑战:
- 冗余性:基础模型的各层 Token 包含大量通用的语义信息,并非所有都对占据预测有用。
- 任务错位:基础模型的表征是在通用流形空间,而占据预测需要具有高度空间辨识度的视觉特征。
- 计算成本:全量微调 VFM 会导致灾难性遗忘并消耗海量算力。
核心贡献:分层几何特征适配器 (HGFA)
为了优雅地解决上述问题,VG3S 提出了 HGFA,这是一个无需微调 VFM 主干网络、仅通过侧边分支进行特征注入的插拔式模块。

1. 分组自适应 Token 融合 (GATF)
模型将 VFM 的不同层进行分组。通过一个自适应加权网络,它能够动态抑制层内冗余的几何响应,只保留最具信息量的场景特征。
2. 任务对齐 Token 精炼 (TATR)
利用轻量级的残差模块对 Token 进行校准,过滤掉与 3D 占据无关的背景噪声。
3. 潜空间特征金字塔 (LSFP)
这是最关键的一步。它将一维 Token 重新映射回二维空间,并通过深度卷积 (DW-Conv) 和 Squeeze-and-Excitation (SE) 机制强制执行局部几何一致性,最后构建出多尺度的特征金字塔。
实验战绩:全方位领先
在 nuScenes 占据预测评估中,VG3S 展示了统治级的表现:

- 性能飞跃:在 SC IoU 这一衡量几何完整性的关键指标上,VG3S 达到了 34.41%,远超基线 GaussianFormer-2 的 30.56%。
- 类别表现:在“Manmade”(人工建筑)和“Drivable Surface”(路面)等类别的提升尤为明显(分别提升至 17.46% 和 42.42%),这直接证明了 VFM 带来的几何一致性确实起到了“补全”作用。
- 通用性:实验显示,VG3S 可以无缝适配包括 DINOv3、DVGT、DGGT 在内的多种 VFM,具有极强的鲁棒性。
可视化分析:几何连续性的回归
从原文提供的对比图可以清晰看到,基线方法产生的路面充满了“空洞”,而 VG3S 输出的语义占据结果更加平滑、连续。

总结与洞察
VG3S 的成功不仅在于它刷高了分数,更在于它确立了一个范式:将几何感知型 VFM 作为冻结的特征提取器,通过精巧的适配器进行 2D 到 3D 的知识转移。
局限性:虽然精度提升显著,但多尺度特征金字塔的引入不可避免地增加了一定的推理延迟。在极其追求实时的自动驾驶车载平台上,如何进一步量化或蒸馏这些 VFM 特征将是未来的关键研究方向。
未来展望:随着 VFM(如 DINOv3)能力的持续进化,这种“大模型当骨干,轻量化适配当下游”的模式很可能成为未来 3D 自动驾驶感知的标准架构。
