夺冠 CVPR 2026:SGCR-SR 凭借语义与几何双重引导,定义图像去阴影的新标杆
Winner of CVPR2026 NTIRE Challenge on Image Shadow Removal: Semantic and Geometric Guidance for Shadow Removal via Cascaded Refinement
本文介绍了 CVPR 2026 NTIRE 图像去阴影挑战赛的冠军方案。作者提出了一个基于 OmniSR 的三阶段级联细化框架(SGCR-SR),通过结合固定的 DINOv2 语义引导和基于深度估计的几何线索,实现了对复杂光照下阴影的渐进式修复,最终在 WSRD+ 2026 测试集上取得了 PSNR 26.680 的 SOTA 战绩。
TL;DR
在 CVPR 2026 NTIRE 图像去阴影(Image Shadow Removal)挑战赛中,来自 AIT 和慕尼黑工大的联合团队凭借 SGCR-SR 框架摘得桂冠。该方法放弃了传统的一步到位式预测,转而采用一种受逆问题启发的三阶段渐进式细化(Cascaded Refinement)策略,并由于引入了 DINOv2 语义和深度几何先验,在极具挑战性的 WSRD+ 数据集上实现了性能的飞跃。
1. 痛点:为什么“一步到位”去不掉阴影?
图像去阴影的本质是光照解耦。现有的单阶段模型(如之前的 SOTA 模型 OmniSR)虽然强大,但在处理以下情况时经常翻车:
- 边界伪影:阴影边缘残留明显的过渡痕迹。
- 全局颜色漂移:去阴影区域与非阴影区域的白平衡不统一。
- 语义歧义:模型分不清这是一块黑色的地毯(反射率低)还是一个阴影(照度低)。
作者认为,去阴影不应该被视为一个简单的映射函数,而是一个迭代细化过程。第一阶段处理主要的遮挡,后两个阶段则像“打磨工”一样,专门针对残余的微小误差进行修正。
2. 核心架构:级联细化与多模态制导
2.1 渐进式细化流水线
SGCR-SR 构建了一个包含 个阶段的级联网络。公式表达为: 其中, 是由 DINOv2 提取的语义特征, 是深度图衍生的几何线索。这种设计的巧妙之处在于,虽然模型各阶段的输入图像在变,但语义和几何参考始终锚定在原始输入上,保证了修复过程不会偏离场景结构。

2.2 几何与语义的魔法
- DINOv2 语义引导:利用冻结的 ViT-L/14 提供全局场景理解,帮助模型识别哪些物体由于类别属性本来就该是暗色。
- Depth Anything V2 几何引导:引入单目深度和表面法线。阴影的形成与几何遮挡密切相关,法线信息能够显著提升模型对阴影边界处理的精确度。
3. 训练黑科技:收缩约束目标函数
多阶段网络常见的痛点是“优化不稳定”:可能第二阶段修好了颜色,但第三阶段又把边缘搞模糊了。为了解决这个问题,作者引入了收缩损失(Contraction Loss):
通过 Stop-gradient (sg) 算子,强制要求当前阶段的误差 必须小于前一阶段。如果效果变差,损失函数就会施加强力惩罚。这种强制性的“单调改进”约束是该模型保持高保真度的核心秘密。
4. 实验战绩与消融分析
4.1 挑战赛统治力
在 NTIRE 2026 榜单上,SGCR-SR 在 PSNR、SSIM 和 FID 等核心指标上全面领先。相比于依赖超大规模 Diffusion Backbones 的方案(如第二名 RAS 和第四名 APRIL-AIGC),这种基于 Transformer 的纯恢复架构在推理速度(0.30s)和参数量(74.3M)上表现得更加平衡和工业友好。

4.2 消融实验:谁才是核心功臣?
根据实验数据(如 Table 3b):
- 去掉 DINOv2:PSNR 暴跌(27.356 -> 25.859),证明语义信息是去阴影的生存之本。
- 去掉收缩约束:PSNR 从 27.356 降至 27.173,验证了该约束对系统性能上限的提升作用。
- 阶段数对比:从 1 阶段到 3 阶段,性能稳步上升,但到 4 阶段后出现收益递减,最终选定 K=3 达到性价比帕累托最优。
上图展示了误差图随阶段增加而逐渐变“暗”的过程,尤其是阴影过渡地带的误差被显著抹除。
5. 总结与展望
SGCR-SR 展示了通过**结构化先验(Semantic + Geometric)与递归算法逻辑(Iterative Refinement)**相结合的力量。它不仅在常规摄影图像上表现出色,在 viewpoint 奇特、纹理复杂的 UAV 无人机图像上也表现出极强的泛化能力。
局限性:尽管 PSNR 表现极致,但多阶段模型在一定程度上会使纹理过度平滑(导致 LPIPS 略微下降)。未来的研究方向可能会集中在如何通过生成式对抗或感知蒸馏,在保持高保真度的同时,找回那些丢失的“感官细节”。
作者总结:去阴影不再是盲目地从 RGB 到 RGB 的映射,而是基于对场景几何与语义的深刻洞察,通过级联“纠错”实现的照明重建。
