[CVPR 2026] 视觉模型真的懂几何吗?揭秘 VLM 内部隐藏的“物理精密尺”

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

总结
问题
方法
结果
要点
摘要

本文通过对 14 种视觉语言模型(VLM)和视觉编码器的冻结特征进行线性探针(Linear Probe)实验,发现模型内部编码了精确的连续几何信息(如关节角度、头姿等)。核心结论是:文本输出路径存在严重的“几何瓶颈”,通过冻结特征提取的精度比文本输出高 3.3 倍,且训练目标比模型架构更能决定几何感知能力。

TL;DR

你以为你的 VLM 是个“空间盲”?其实它只是“表达障碍”。最新研究发现,像 SigLIP 2 或 DINOv3 这样的视觉模型,其内部特征对连续几何(如手部关节角度)的感知精度极高。通过一个极小的线性探针,我们可以提炼出比文本输出精确 3 倍以上的测量结果。研究证明,这种几何能力的差异主要源于训练目标,而非模型架构。

背景定位:被低估的视觉表征

在当前的学术界,大家倾向于通过多轮对话(CoT)来增强 VLM 的空间能力。然而,本文一针见血地指出:几何感知就在那里,只是文本路径把它弄丢了。 该工作在学术坐标系中属于典型的“表征探测(Probing)”研究,旨在量化视觉基础模型作为“几何传感器”的真实潜力。

痛点深挖:文本路径的“降级”

开发者经常发现,问 VLM “手部关节弯曲了多少度?”,模型给出的数字往往张冠李戴。

  • 现状:即使是 SOTA 模型,文本输出的平均绝对误差(MAE)也在 20° 以上。
  • 直觉:作者猜测,视觉编码器已经捕获了像素间的拓扑关系,但为了适配文本 Tokenizer 的离散分布,这些连续的几何信号在解码阶段被过滤掉了。

核心方法:线性探针与功能收敛

作者并没有修改任何模型参数,而是直接在冻结的特征(Frozen Features)上加上了一个只有约 6000 参数的**降低秩回归(Reduced-Rank Regression, RRR)**层。

1. 架构解析

实验覆盖了从 CNN(ConvNeXt)到 ViT 的多种架构,以及从 DINO(自监督)到 SigLIP(对比学习)的多种路径。

模型架构与探针示意图

2. 功能收敛(Functional Convergence)

一个极其惊人的发现是:五个表征完全不同的模型(CKA 相似度仅 0.41),在几何预测的 R² 上竟然奇迹般地统一在 0.55 左右。这意味着,无论模型内部如何组织数据,最终它们都提取出了相同的物理规律。 这有力地支持了“柏拉图表征假设”——即高性能模型都在趋向于对现实世界的统一建模。

实验战绩:精度全方位碾压

实验对比了“原生文本输出”、“LoRA 微调”和“线性探针”的效果:

模式MAE (越小越好)解析率
文本Few-shot20.0°不稳定
冻结线性探针6.14°100%
LoRA微调文本6.51°100%

不同模型的几何性能分布

关键发现:

  1. 训练目标 > 架构:对比消融实验显示,同样的参数量,自监督/对比学习模型比纯监督学习模型(如 ImageNet 预训练)高出 0.15 R²。
  2. LLM 的副作用:对于 Qwen 或 Gemma 等模型,在进入 LLM 解码器后,手部这种精细几何信息会随层数增加而快速衰减(见下方层轨迹图)。

各模型层级精度变化轨迹

深度洞察:工业界的“省钱”配方

这项研究为开发者提供了一个极具性价比的方案:

  • 模块化传感器:你不需要为每个几何任务(手势、头姿、物体位姿)训练专用模型。
  • 极简适配:只需准备几千张标注图像,在现有的基础模型(如 SigLIP 2)提取特征,训练一个几千参数的线性层(几 KB 大小),就能获得媲美专业模型的测量精度。

总结与局限

Takeaway:VLM 不缺几何知识,缺的是“读数设备”。 局限性:尽管 R² 达到了 0.55,但仍有 45% 的方差无法解释,特别是在目标分布方差极小的任务(如拇指关节)中,冻结特征的表现依然挣扎。另外,对于空间极其弥散的信号(如 BIWI 的 Roll 角),这种方法需要配合 Attention Pooling 才能生效。


本文为学术前沿解读,旨在揭示基础模型背后的物理直觉。

发现相似论文

试试这些示例

  • 查找最近其他关于视觉语言模型 (VLM) 在空间推理与 3D 物理量回归任务中“文本瓶颈” (Text Bottleneck) 现象的研究。
  • 哪篇论文最早系统性地提出了“柏拉图表征假设” (Platonic Representation Hypothesis),本文对其结论做出了哪些修正或补充?
  • 有哪些研究探讨了自监督学习 (Self-supervised) 与对比学习 (Contrastive learning) 在捕获图像连续底层几何特征方面的具体差异?
目录
[CVPR 2026] 视觉模型真的懂几何吗?揭秘 VLM 内部隐藏的“物理精密尺”
1. TL;DR
2. 背景定位:被低估的视觉表征
3. 痛点深挖:文本路径的“降级”
4. 核心方法:线性探针与功能收敛
4.1. 1. 架构解析
4.2. 2. 功能收敛(Functional Convergence)
5. 实验战绩:精度全方位碾压
5.1. 关键发现:
6. 深度洞察:工业界的“省钱”配方
7. 总结与局限