[CVPR 2026] MoRe:运动感知 Transformer 突破,实现 SOTA 级实时 4D 动态重构
MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer
本文提出了 MoRe,一种用于单目视频 4D 重构的动态感知前馈 Transformer 框架。该方法通过 Attention-forcing 策略实现了动态运动与静态结构的显式解耦,并在流式推理中结合分块因果注意力(Grouped Causal Attention)与类 BA 全球优化,在保持实时性的同时实现了 SOTA 级别的重构精度。
TL;DR
传统的 4D 重构在面对“乱动”的对象时往往会“带偏”相机的判断。清华大学与理想汽车的研究团队联合推出了 MoRe (Motion-aware Feed-forward 4D Reconstruction Transformer)。它通过一种聪明的 Attention-forcing 策略,教模型在训练时学会自动忽略移动物体,并结合 Grouped Causal Attention 实现了极速的流式推理(30+ FPS),在动态场景的位姿估计与深度还原上均达到了 SOTA 水平。
1. 痛点:为什么动态场景是重构的“杀手”?
在 3D/4D 重构领域,假设场景是静态的是一种长期以来的“默认潜规则”。然而,真实世界充满了干扰:行人、车辆以及相机自身的剧烈抖动。
目前的 SOTA 模型(如 VGGT)虽然能前馈生成点云,但它们的 Camera Token(用于估计相机参数的特征)往往会“雨露均沾”地关注整张图像。如果画面中心有一个快速移动的物体,模型会误以为是相机在反向运动,从而导致位姿估计(Pose Estimation)发生剧烈偏差,最终重构出的点云就像被揉皱的废纸。
2. 核心机理:如何让模型“冷落”动态物体?
2.1 Motion-aligned Attention (运动对齐注意力)
作者的 Insight 非常直观:既然动态区域会干扰位姿,那就通过训练让模型学会“视而不见”。
- 训练阶段 (Training):利用 ground-truth 运动掩码计算每个 Patch 的运动分值。
- 强迫引导 (Forcing):设计了一个特殊的损失函数 ,强迫 Camera Token 的注意力权重避开高动态区域,专注于稳定的背景。
- 推理阶段 (Inference):模型由于在训练中养成了这种“品味”,即使不输入任何掩码,也能自发地关注静态特征,实现 Test-time-free 的运动解耦。
图 1:MoRe 整体架构。左侧展示了 Attention-forcing 机制,右侧为流式推理流程。
2.2 Grouped Causal Attention (分块因果注意力)
为了实现视频流的处理,直接套用 LLM 的因果注意力(Causal Attention)会破坏图像内部的像素关联。MoRe 推出了分块设计:
- 帧内 (Intra-frame):Token 之间可以自由地互相看(Bidirectional),保证空间一致性的推理。
- 帧间 (Inter-frame):采用严格的因果掩码,当前帧只看过去帧。这样可以利用 KV 缓存技术,极大地提升处理长视频时的速度。
图 2:Grouped Causal Attention 示意图。这种分块设计兼顾了时序逻辑与空间完整性。
3. BA-like Refinement:Transformer 里的“平差”
单纯的因果推理容易产生“漂移”。MoRe 在流式推理结束后,增加了一个极轻量级的全局修正步骤。模型会缓存每帧的 Camera Query,在序列结束时进行一次全局注意力聚合(Global Aggregation)。这在物理直觉上非常接近传统 SLAM 中的 Bundle Adjustment (BA),即通过全局信息消除局部累积误差。
4. 实验表现:速度与精度的双重胜利
在多个极具挑战性的动态数据集(Sintel, TUM-dynamics, Bonn)上,MoRe 展现了统治级的表现:
- 位姿精度:在 Sintel 数据集上,MoRe (Streaming) 的绝对平移误差 (ATE) 仅为 0.1474,大幅优于此前的流式 SOTA 方法 Stream3R (0.2144)。
- 推理效率:在输入分辨率 512x144 下,帧率高达 30 FPS,完全满足自动驾驶或机器人实时交互的需求。
图 3:重构效果对比。可以看到 MoRe 在动态场景下生成的点云更加准确,几乎没有背景撕裂现象。
5. 总结与洞察:4D 重构的未来
MoRe 的成功在于它拒绝了昂贵的推理期计算。它没有像传统方法那样在运行期间实时计算光流或分割掩码,而是通过高效的注意力机制(Attention-forcing)将这种“知识”内化到了模型的权重中。
局限性分析: 尽管表现优异,由于 MoRe 强依赖于运动解析,在剧烈运动模糊(Motion Blur)或者物体极速非刚性形变的情况下,注意力对其静态特征的捕获可能会失效。这提示我们,未来的研究或许需要将物理运动的连续性先验更深地集成进隐空间中。
对于追求实时 4D 空间感知(Spatial Intelligence)的开发者来说,MoRe 提供了一个极佳的工程参考范式:因果注意力 + 全局聚合 + 显式运动解耦。
