[ICML 2025] 极化之熵:为什么 Softmax 总是让注意力背离“雨露均沾”?
Gradient Flow Polarizes Softmax Outputs towards Low-Entropy Solutions
本文提出了 Value-Softmax 模型,通过分析梯度流(Gradient Flow)动力学,证明了在 Softmax 参数化下,模型训练过程天然存在向低熵(稀疏)解偏移的隐式偏置(Implicit Bias)。该研究为 Transformer 中出现的 Attention Sinks 和 Massive Activations 等现象提供了严谨的理论支撑。
TL;DR
在 Transformer 的世界里,注意力机制就像是一个容易走极端的决策者。本文提出了一种名为 Value-Softmax 的简易模型,通过梯度流(Gradient Flow)的严谨推导告诉我们:Softmax 结构的参数化本身就带有一种“隐式偏置”,它会推着模型去选择那些极其稀疏、甚至有点“死板”的低熵解。这解释了为什么 LLM 中会出现 Attention Sinks(注意力汇聚),也揭示了模型决策在本质上为何容易被单个 Token 绑架。
背景定位:从现象到本质
研究者们早已观察到,即便任务不需要,Transformer 的注意力头也经常会死死盯着序列开头的 BOS 标签(Attention Sink),或者产生数值惊人的 Massive Activations。
以往的解释通常是“因为第一个 Token 包含全局信息”或者“Softmax 需要一个地方倒垃圾(垃圾桶效应)”。但本文作者认为:这不完全是任务的锅,而是梯度的本能选择。
核心直觉:梯度流的“排斥效应”
作者将注意力头简化为 ,其中 是 Value 矩阵, 是注意力分值向量。在优化过程中,梯度流会产生一种类似于生物进化论中 复制者动力学(Replicator Dynamics) 的效果。
具体来说,Softmax 的 Jacobian 矩阵形式决定了坐标间的交互遵循“适者生存”:
- 坐标排斥:各维度的投影值 之间存在排斥力,强者的优势会随时间不断放大。
- 秩序平移:一旦某个分值处于初始领先地位,梯度流会保护这个顺序,使其永远不会被后来者超越。
图 1:实验验证显示,注意力分值 会迅速极化。蓝色曲线代表的初始最大分值奔向 1.0,而其他分值全部趋于 0。
关键发现:分类与回归的极化差异
作者对比了不同损失函数下的极化现象:
- Logistic Loss (分类):极化是不可逆转的终局。作者证明了注意力权重必然收敛至 One-hot 向量。这意味着模型倾向于只看一个 Token 来做决定。
- Square Loss (回归):极化的极值取决于收敛速度。如果问题本身很难(条件数大),极化现象会更严重。
这种极化行为在 Sigmoid 或 ReLU 这种逐元素激活函数中是不存在的。因为 Softmax 的归一化项(分母部分)在梯度计算中引入了一种“全连接式的均值交互”,这种交互是诱发极化的罪魁祸首。
实验战绩:从 Induction Heads 到 7B LLM
为了验证理论,作者在诱导头(Induction Heads)任务和真实的 7B 预训练模型上做了对比。
图 2:在诱导任务中,使用 Softmax 产生的 Sink Heads(汇聚头)比例远高于 Unnormalized 变体。
在对真实的 7B 模型进行 Sparsity Score 测量时发现:
- Softmax 模型:注意力分布极度集中,最大权重 Token 占据了极大比例。
- Sigmoid 模型:分布更平滑,极化现象显著减弱。
潜在危机:Token 影响力失衡
这种极化偏置带来了一个严重的病态结果:模型极易受到扰动攻击。
由于模型倾向于将所有“赌注”押在某一个 Token 上(极化为 One-hot),如果这个关键 Token 发生一点点偏移,整个模型的预测结果就可能彻底翻转(Adversarial Flip)。实验中,1 层 1 头的 Softmax 模型在面临单 Token 攻击时,成功率极高。
总结与启示
这篇论文优雅地解释了 Transformer 内部那些看似神秘的“汇聚”现象。
Takeaway:
- 如果你希望增加模型的鲁棒性,或者减少长文本处理时的“注意力坍塌”,或许该重新审视 Softmax 的霸权。
- 隐式优化偏置的存在意味着,架构即便能表达多种方案,梯度下降也会由于其动力学特性,诱导模型走向最“极端”的那一种。
扩展阅读
想更深入了解这种极化,可以关注文中提到的 Replicator Dynamics。在社会学和生物学中,这也是解释群体观点走向极端的核心数学工具。
