WF-Diff:当 Transformer 遇见频率扩散,水下图像增强的新范式

2311.16845v1

总结
问题
方法
结果
要点
摘要

本文提出了 WF-Diff,一种基于小波变换的傅里叶信息交互与频率扩散调节的水下图像增强(UIE)框架。该方法通过结合 Transformer 结构的模型(WFI2-net)与即插即用的频率残差扩散调节模块(FRDAM),在多个真实水下图像数据集(如 UIEBD, LSUI)上达到了 SOTA 性能。

TL;DR

水下成像环境复杂,光线吸收与散射导致图像往往自带“原神滤镜”(严重绿/蓝偏和模糊)。本文提出的 WF-Diff 框架,首次透彻地将小波变换 (Wavelet)、傅里叶变换 (Fourier) 与 扩散模型 (Diffusion) 结合。它不再盲目地在像素上“修补”,而是先深入频域分而治之,再通过扩散模型微调残差。该方法在 UIEBD 等主流榜单上刷新了记录,PSNR 提升显著。

核心洞察:为什么要深入“频域”?

作者通过一个有趣的实验(见下图)揭示了本质:

  1. 幅度谱 (Amplitude) 承载了水下图像的退化信息(如色偏)。
  2. 小波解耦:将图像分解后发现,低频分量决定了颜色的准确性,而高频分量则锁定了纹理与细节的崩坏。

以往的方法试图用一套逻辑处理所有频率,结果往往是“顾了颜色、丢了细节”。

探究实验:图1展示了交换幅度分量对视觉效果的影响

架构解析:WF-Diff 的两步走策略

WF-Diff 的整体流程非常优雅,分为两个可拆卸的部分:

1. WFI2-net:前哨增强站

它采用 U-Net 结构,但在内部植入了两大黑科技:

  • Wide Transformer Block (WTB):利用多尺度扩张卷积和自注意力捕获全局依赖,专门对付高频子带中的结构丢失。
  • Spatial-Frequency Fusion Block (SFFB):在低频子带上同时进行空间域卷积和频域幅度修正,确保颜色初步回归自然。
  • Cross-Frequency Conditioner (CFC):让高频和低频信息不再互为孤岛,实现跨频率的特征交互。

2. FRDAM:扩散调节器

这是本文最惊艳的设计。传统的扩散模型(Diffusion)从纯噪声生成图像,容易产生不可控的伪影。FRDAM 提出了 “残差学习”:

  • 它不直接生成图像,而是学习初步增强结果与 Ground-truth 之间的残差分布。
  • 分而治之:设有 LDFB(低频扩散分支)和 HDFB(高频扩散分支),分别精准调优颜色基调和微观纹理。

WF-Diff 总体架构图

实验战绩:全方位的视觉收割

在真实世界数据集 UIEBD 和 LSUI 的横向对比中,WF-Diff 展现了降维打击般的优势:

  • 对比度与颜色:完全去除了水下常见的重度绿偏。
  • 细节恢复:在鱼群、珊瑚礁等复杂纹理上,边缘锐利度远超 baseline。

从数据上看,PSNR 从主流的 20-21dB 跃升至 23.86dB,这在 UIE 任务中是巨大的飞跃。

视觉效果对比图

深度思考:未来的进击方向

尽管 WF-Diff 效果拔群,但作者也坦诚地指出了当前扩散模型的通病——推理速度(Inference Speed)。由于涉及两个分支的多次迭代采样,实时性仍是短板。

总结 (Takeaway):这篇论文的价值在于提供了一种“频域+残差扩散”的标准化思路。对于从事底层视觉研究的开发者,这种将任务拆解为“先初步恢复(Transformer/CNN),再精细建模残差(Diffusion)”的模式,具有极高的重用价值。


注:文中公式推导及消融实验细节请参考原文。项目代码已开源。

发现相似论文

试试这些示例

  • 查找最近一年内利用傅里叶变换或小波分析进行非均匀退化图像恢复的顶级会议论文。
  • 针对扩散模型在底层视觉任务中推理速度慢的问题,目前有哪些主流的加速采样方案(如 Consistency Models 或 DDIM 优化)?
  • 调研如何将本论文中的频率残差扩散思想应用到水下视频流的实时增强中,并保持帧间时空一致性。
目录
WF-Diff:当 Transformer 遇见频率扩散,水下图像增强的新范式
1. TL;DR
2. 核心洞察:为什么要深入“频域”?
3. 架构解析:WF-Diff 的两步走策略
3.1. 1. WFI2-net:前哨增强站
3.2. 2. FRDAM:扩散调节器
4. 实验战绩:全方位的视觉收割
5. 深度思考:未来的进击方向