[CVPR 2025] Holi-Spatial:视频流进化论,开启 3D 空间智能的全自动标注时代
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
本文提出了 Holi-Spatial,这是首个能够将原始视频流自动转化为大规模、高质量 3D 空间标注的全自动流水线。该框架产出了包含 1.2 万个 3DGS 场景及 400 万量级标注的 Holi-Spatial-4M 数据集,显著提升了多模态大模型(LMM)的 3D 感知与推理能力。
TL;DR
空间智能(Spatial Intelligence)的短板一直在于“数据贫血”。由上海人工智能实验室、西工大、南洋理工等单位联合提出的 Holi-Spatial 彻底改变了这一现状。它是一个全自动流水线,能直接将普通的视频流变身成包含几何结构、语义标签、3D 边界框及空间 QA 对的高精度 3D 场景。其发布的 Holi-Spatial-4M 数据集凭借 400 万量级的标注,让 Qwen3-VL 模型的空间推理能力产生了质的飞跃。
空间智能的“最后一公里”:为什么数据这么难?
尽管 2D 领域拥有 LAION-5B 这样规模的数据库,但 3D 空间领域依然在 ScanNet 等几千个老旧场景里“打转”。
- 采集难:依赖特定的深度相机或 LiDAR 扫描仪。
- 标注难:人工绘制 3D 边界框和语义分割点云极其低效。
- 一致性差:现有的模型生成法(如直接用 2D 预测投影)往往会出现漂浮物(Floaters)或物体断裂,缺乏几何逻辑。
核心机制:Holi-Spatial 的三阶进化论
Holi-Spatial 的本质是利用 3D Gaussian Splatting (3DGS) 作为几何底座,并在其上叠加了 VLM 的语义理解能力。
1. 几何优化(Geometric Optimization)
不仅仅是跑一个 3DGS,作者引入了来自 Depth-Anything-V3 的单目深度先验,并结合表面重构约束。这种做法消除了 3DGS 中常见的“幽灵伪影”,让生成的深度图在多视图间严丝合缝。
2. 从 2D 感知到 3D 投影
通过 Gemini3-Pro 产生开放词汇标签,并引导 SAM3 进行实例分割。关键创新在于几何感知过滤策略:在投影点云到 3D 空间前,先进行掩码腐蚀(Erosion)和网格引导过滤,彻底剔除目标边缘的噪点。

3. 场景级精炼(Scene-level Refinement)
这是保证数据集质量的“杀手锏”。它通过 3D IoU 将不同视角下的碎片化观察合并,并利用地平面检测实现 Gravity-Alignment(重力对齐)。最后,针对置信度模糊的物体,专门派出一个 VLM Agent “放大看一眼”来做最终裁决。
上图展示了优化后的标注(右)比 ScanNet 官方人工标注(左)拥有更锐利的边界和更精确的分类。
实验战绩:全方位的 SOTA 碾压
在 ScanNet++ 评估中,Holi-Spatial 展示了统治级的性能:
- 几何精度:深度估计 F1 达到 0.89(远超基线的 0.39)。
- 3D 检测:AP25 高达 81.06,比之前的 3D-VLM 强了一个数量级。
- 下游模型强化:微调后的 Qwen3-VL-8B 在空间推理基准 MindCube 上表现暴涨。

深度洞察:空间智能的“飞轮”已在转动
Holi-Spatial 的意义不仅在于提供了一个 4M 大的数据集,更在于验证了一个逻辑:复杂的 3D 任务可以通过分解为“几何优化+2D 基础模型+Agent 验证”来全自动解决。
这种“非人类干预(Non-human-in-the-loop)”的流水线意味着,只要有更多的视频输入(哪怕是 YouTube 上的室内探店视频),我们就能不断扩充空间感知库。
局限与未来
虽然精炼过程有效,但对于重度遮挡或高速运动的模糊视频,重建质量仍有待提升。此外,目前的计算开销主要集中在每场景的优化(Per-scene optimization)上。未来的改进方向可能是引入更通用的 Feed-forward(前馈) 3D 重建模型,进一步缩短数据生产周期。
总结:Holi-Spatial 填补了从视频流到 3D 结构化知识的空白,是构建万物互联、理解物理世界的关键一步。
