[CVPR 2026] DAGE:双流架构突破 2K 高清视频几何重建瓶颈
DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
本文提出了 DAGE,一种用于高效、细粒度几何估计的双流 Transformer 架构。该方法通过解耦全局一致性与局部细节,在保持 2K 高分辨率和长序列(达 1000 帧)处理能力的同时,实现了视角一致的深度估计与相机位姿恢复,在多个基准测试中达到 SOTA。
TL;DR
在 3D 重建领域,我们一直面临“鱼和熊掌不可兼得”的困境:全局一致性(Global Coherence)通常意味着要牺牲图像分辨率,而高分辨率(High-Resolution)又往往导致多视角下深度跳变。DAGE 提出了一种双流 Transformer (Dual-Stream Transformer) 架构,通过解耦处理,在单台 GPU 上实现了高达 2K 分辨率、1000 帧长序列的细粒度几何估计与相机位姿预测。
1. 痛点:为什么 SOTA 模型也变“近视”了?
目前最前沿的 feed-forward 重建模型(如 VGGT 和 Pi3)核心依赖全局注意力机制(Global Attention)。虽然这种机制能感知整个场景的拓扑结构,但其计算成本随 Token 数量呈二次方增长。
- 结果:为了跑通模型,研究者不得不将输入图像压缩至 518px 甚至更低。
- 代价:物体的边缘变模糊了,细小的电线、树枝等结构消失不见,重建出的 3D 点云像被磨皮了一样。
与此同时,单图深度估计模型(如 DepthPro)虽然能出 2K 高清图,但在视频中会出现剧烈的抖动(Temporal Jitter),且无法提供统一的相机轨迹。
2. 核心直觉:全局与局部,各司其职
DAGE 的核心 Insight 是:确定相机位姿和全局比例不需要 2K 分辨率,而还原物体边缘则绝对需要。
为此,DAGE 设计了两个平行的流:
- LR Stream(低分辨率流):处理 252px 的极小图。由于 Token 少,它可以肆无忌惮地开全局注意力,负责把控大局(相机位姿、全局一致性)。
- HR Stream(高分辨率流):处理原始的 2K 大图。为了效率,它逐帧独立运行,通过强大的预训练 ViT 提取极致的边缘纹理。
架构详解
图 2: DAGE 架构概览。底部 LR 流负责“大局观”,顶部 HR 流负责“高清细节”。
这里的核心技术挑战在于:如何让两个分辨率差了 10 倍的流“对话”? 作者设计了一个 Lightweight Adapter。它不仅仅是简单的上采样拼接,而是使用了基于 Cross-Attention 的融合机制,并引入了“像素校准”的 RoPE(旋转位置编码)。通过这种方式,LR 流中的 3D 一致性约束被精准地“注入”到了 HR 流的每一颗像素中。
3. 实验战绩:更快、更准、更清晰
3.1 速度的质变
由于将计算最重的全局注意力限制在低分辨率下,DAGE 在高分辨率下的效率优势极其夸张。
| 分辨率 | VGGT [95] | DAGE (Ours) | 加速比 |
|---|---|---|---|
| 540p | 30.1 FPS | 65.4 FPS | ~2x |
| 2K | OOM (显存溢出) | 5.6 FPS | 无限/SOTA |
3.2 细节表现力
在可视化对比中,DAGE 展现出了压倒性的优势。特别是在薄结构(Thin Structures)的处理上,它捕捉到了前人工作中丢失的电线和细碎的植物边缘。
图 4: 视频深度可视化对比。红框部分显示 DAGE 重现了极其细微的边缘,而传统方法则一片模糊。
4. 深度洞察:为什么这能 Work?
DAGE 成功的关键在于其 位置编码对齐策略(Snapping Mechanism)。 在 Cross-Attention 时,HR Token 会自动寻找 LR 特征图上距离自己最近的格子进行对齐。这不仅解决了分辨率不匹配的问题,还避免了直接进行插值(Interpolation)带来的高频信息损失。
此外,作者使用了 知识蒸馏(Knowledge Distillation),让仅 252px 的低分流去学习来自 518px 强大模型的特征表示,弥补了分辨率降低带来的语义损失。
5. 总结与启示
DAGE 的出现,为 Metric-scale(米级尺度) 且 View-consistent(视角一致) 的 feed-forward 重建树立了新行业标杆。
- 核心贡献:首次在统一框架下平衡了计算效率、全局一致性与 2K 分辨率细节。
- 局限性:尽管对静态场景处理完美,但在处理极快速的非刚性运动(Non-rigid motion)时仍有挑战。
- 未来展望:这种双流设计很可能会成为 3D 视觉大模型的标准组件,特别是在自动驾驶和 AR/VR 等需要高精局部细节与大范围空间感知结合的场景中。
