[ICLR 2025] LATENT-MARK:对抗神经重合成,深藏在潜空间里的音频水印
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
本文提出了 LATENT-MARK,这是首个专门针对神经重合成(Neural Resynthesis)攻击而设计的零比特(Zero-bit)音频水印框架。通过在神经编解码器的不变潜空间(Latent Space)中嵌入定向偏移,该方法在保持高感知保真度的同时,实现了对黑盒编解码器攻击的强大鲁棒性。
TL;DR
随着 EnCodec 和 SNAC 等神经音频编解码器的普及,传统的音频水印技术正面临前所未有的生存危机。本文提出的 LATENT-MARK 改变了底层逻辑:不再尝试在容易被抹除的波形表面“涂抹”噪声,而是深入神经网络的潜空间(Latent Space),通过优化波形产生一种编解码器无法丢弃的“语义偏移”。它不仅在神经重合成攻击下表现出色(SOTA),还具备极强的黑盒模型迁移能力。
1. 痛点:为什么神经编解码器是水印克星?
在音频处理的“旧时代”,攻击手段主要是 MP3 压缩、滤波或加噪。传统水印(如 AudioSeal, WavMark)通过心理声学模型隐藏在听觉掩蔽阈值之下,表现得相当稳健。
然而,**神经重合成(Neural Resynthesis)**彻底改变了游戏规则。现代神经编解码器不再是简单的信号删减,而是:
- 语义投影:将波形映射到离散的潜记号(Latent Tokens)。
- 流形约束:只保留对人类听觉有意义的语义特征,丢弃一切“不在流形上”的残差。
作者发现,即使在肉眼看不出波形变化的重合成后,传统水印信号也会因为相位剧烈偏移和语义重构而彻底消失。
图 (a) 显示水印嵌入后的波形一致性;图 (b) 揭示了 SNAC 处理后波形结构的剧烈变化。
2. 核心机理:潜空间定向偏移 (Latent-Space Shift)
LATENT-MARK 的核心直觉是:如果水印本身就是编解码器试图保护的“语义特征”,它就能活下来。
2.1 潜流形对齐
作者将水印嵌入建模为一个带约束的优化问题。不是简单加噪,而是通过梯度上升,微调输入波形 ,使得编解码器的编码器 输出的潜表示 朝向一个预定义的“秘密向量” 产生偏移。
2.2 秘密轴的选择:Latent-Cluster
选择哪个方向(Axis)进行偏移至关重要。作者对比了三种策略:
- Random: 随机方向。
- PCA: 主成分方向。
- Cluster (本文推荐): 使用 K-means 对 Codebook 聚类,以两个簇中心的连线作为偏移方向。
Why? 实验证明 Cluster 效果最好。因为这个方向指向了潜空间的高密度区域,编解码器在量化阶段会自然地保留这种趋向性,而不是将其视为噪声抹除。
图 2 展示了整体管线:通过优化扰动 ,在不改变听感的前提下,诱导潜表示产生检测可见的偏移。
3. 跨编解码器优化:解决黑盒迁移
白盒优化虽然强,但现实中攻击者可能使用完全不同的编解码器。为了实现 Zero-shot Transferability,作者引入了联合交叉编解码器优化 (Joint Cross-Codec Optimization):
- 同时在 SNAC, DAC, EnCodec 等多个代理模型上进行优化。
- 平衡梯度:由于不同模型的潜空间尺度不同,引入了校准常数来平衡各自模型的损失贡献。
- 中位数检测:在检测阶段,使用多模型的 Normalized Margin 的中位数作为最终评分,有效剔除异常干扰。
4. 实验战绩
在 LibriSpeech(语言)、MAESTRO(音乐)、Clotho(环境音)等 8 个数据集上的测试显示:
- 神经鲁棒性:传统方法(AudioSeal, WavMark)检测率近乎 0%,而 LATENT-MARK 始终保持在 60%-93% 之间。
- 音质损耗:在 SI-SNR 和感知评价指标 UTMOS 上,LATENT-MARK 与高度保守的 SilentCipher 处于同一梯队,远好于传统加噪方法。
表 1 清晰地展示了 LATENT-MARK 在 Survivability (Sur.) 上的压倒性优势。
5. 资深主编点评
LATENT-MARK 的成功在于它精准捕捉到了神经音频处理的**“不变性” (Invariants)**。它不仅解决了当前 AI 音频溯源的紧迫问题,更为未来多模态大模型的版权保护指明了方向:水印不应是信号的补丁,而应是潜空间几何结构的内在属性。
局限性:尽管跨模型迁移表现不错,但对于完全异构或超低比特率的极端压缩,仍存在检测准确率下降的风险。此外,150 步的迭代优化在实时性要求极高的场景下仍有优化空间。
