Any Resolution Any Geometry:从多视角到多 Patch 的 4K/8K 几何重建新范式

Any Resolution Any Geometry: From Multi-View To Multi-Patch

总结
问题
方法
结果
要点
摘要

本文提出了 URGT (Ultra Resolution Geometry Transformer),一种旨在解决高分辨率单目深度与法向联合估计问题的 Multi-patch Transformer 框架。通过将单张高倍率图像(如 4K/8K)视为多个“虚拟视角”进行 Patch 化处理,URGT 在 UnrealStereo4K 榜单上取得了 SOTA 成就,将 AbsRel 从 0.0582 显著降至 0.0291。

TL;DR

在 3D 场景理解中,单纯追求高分辨率并不难,难的是如何在保留极致局部纹理的同时,维持全局的几何一致性。本文提出的 URGT (Ultra Resolution Geometry Transformer) 通过将单张高分图像重构为“多 Patch 集合”,并利用 Transformer 的长程建模能力,实现了深度与法向的完美联合细化。其在 UnrealStereo4K 上的 AbsRel 降低了近 50%,且支持从 2K 到 8K 的无缝分辨率扩展。

痛点深挖:碎裂的高清世界

目前的高分辨率几何估计(Depth & Normal Estimation)主要面临两大困境:

  1. 显存瓶颈:由于计算量随分辨率平方级增长,强如 ViT 也难以直接处理 4K 原图。
  2. 边界断层:现有的 Patch-based 方法(如 PatchRefiner)通常将图像切块并分别独立细化。虽然局部细节上去了,但块与块之间的接缝及其物理意义上的深度阶跃往往无法对齐,导致“拼图感”严重。
  3. 缺乏耦合:深度代表宏观布局,法向代表微观方向,忽略两者的几何约束会导致预测出的 3D 表面抖动不平。

核心动机:将 Patch 视为“视角”

作者受到了最近火热的多视角重建(Multi-view Reconstruction)模型(如 DUSt3R, VGGT)的启发。在多视角任务中,Transformer 能够通过 Cross-view Attention 在不同视角的图片间传播几何约束。 Idea: 既然如此,为什么不把一张 4K 图切成的 Patchs,看作是从同一个大场景中提取的、具有高度重叠信息的“虚拟多视角”呢?

方法论详解:URGT 架构解析

URGT 的核心在于如何让分散的 Patch 们意识到自己属于同一个整体。

1. 统一的 Patch 表征

模型输入不仅包含高分的 RGB Patch,还引入了来自 Depth-Anything v2 和 Metric3D v2 的粗略(Coarse)深度/法向先验。通过简单的加法,Token 同时携带了视觉、尺度和方向的三重信息。

2. 全局位置编码 (Global RoPE)

传统的 RoPE 在分块处理时只知道 Patch 内的相对位置。URGT 将每个 Token 的坐标映射回原始高精度图的全局坐标 ,这使得模型即使在处理不相邻的 Patch 时,也能精准感知它们在物理空间中的距离。

3. Intra- & Cross-Patch Attention

这是打破边界感的关键。URGT 交替使用两种注意力模块:

  • Intra-patch:专注局部,打磨纹理边缘。
  • Cross-patch:面向全身,确保 Patch A 的深度末端能与 Patch B 的起始平滑衔接。

模型架构图 图 1:URGT 流程:先粗后细,通过 Cross-patch Attention 实现全局一致性。

4. GridMix 采样策略

为了不让模型死记硬背固定的切块方式,训练过程中引入了 GridMix,随机选择 1x1, 2x2, 3x3 或 4x4 的组织结构。这种“拼图增强”极大地提升了模型在面对任意分辨率输入时的稳定性。

实验与结果

在 UnrealStereo4K 这种极具挑战性的数据集上,URGT 展示了统治级的性能:

MethodAbsRel ↓RMSE ↓Median Angular Error ↓
Coarse Baseline0.08122.8633.15
PatchRefiner (p=49)0.05822.17-
Ours (Joint)0.02911.3128.83

实验结果对比 图 2:定性对比。注意红框中的植物和栏杆,URGT 处理出的深度边界极其锋利且无断裂,对比之下 baseline 显得模糊且充满伪影。

此外,该模型在 8K 分辨率下的泛化能力也非常惊人,甚至连 OOD(分布外)的漫画风格图片也能推断出合理的几何结构(见图 3)。

8K Manga 泛化结果 图 3:8K 漫画风格图片的深度与法向估计,展示了极强的 Zero-shot 能力。

深度洞察与总结

URGT 的成功本质上归功于它的 "Global Conscious" (全局意识)。它不再是盲目地细化每一个 Patch 像素,而是在 Transformer 的帮助下,让每个 Patch 都在“通盘考虑”整个图像的几何拓扑。

总结 (Takeaway):

  • 架构优势:将多视角注意力机制降维打击到单图 Patch 细化任务中。
  • 工业潜力:极低的推理延迟(4K 图像约 0.97s),足以支撑下游的 3D Gaussian Splatting 或 AR 应用。
  • 局限性:在处理强反射表面(如镜子)时,模型仍会将其误判为深度延伸(见 Figure 9),这是单目视觉的固有难题,未来可能需要引入专门的非朗伯体(Non-Lambertian)建模。

随着 URGT 的开源,超高清 3D 几何重建的门槛正在进一步降低,我们也期待看到它在电影特效和自动驾驶仿真中的应用。

发现相似论文

试试这些示例

  • 查找最近其他使用 Patch-based 策略解决高分辨率单目深度估计(Monocular Depth Estimation)并重点消除边界伪影的 SOTA 论文。
  • 哪篇论文最早提出了 VGGT 或 DUSt3R 等多视角几何 Transformer 架构,本文是如何将其从多视角场景迁移到单图多 Patch 场景的?
  • 调研目前在超高分辨率(4K/8K)几何建模领域,有哪些研究结合了扩散模型(Diffusion Priors)与分块细化技术?
目录
Any Resolution Any Geometry:从多视角到多 Patch 的 4K/8K 几何重建新范式
1. TL;DR
2. 痛点深挖:碎裂的高清世界
3. 核心动机:将 Patch 视为“视角”
4. 方法论详解:URGT 架构解析
4.1. 1. 统一的 Patch 表征
4.2. 2. 全局位置编码 (Global RoPE)
4.3. 3. Intra- & Cross-Patch Attention
4.4. 4. GridMix 采样策略
5. 实验与结果
6. 深度洞察与总结