[arXiv 2026] MOGA 优化器:打破宽度缩放魔咒,实现完美超参数迁移

On the Width Scaling of Neural Optimizers Under Matrix Operator Norms I: Row/Column Normalization and Hyperparameter Transfer

总结
问题
方法
结果
要点
摘要

本文提出了 MOGA (Matrix Operator Geometry Aware) 优化器框架,通过引入“均值归一化矩阵算子范数” (Mean-normalized Matrix Operator Norms),实现了深度神经网络在不同宽度下的零样本超参数迁移(0-shot Hyperparameter Transfer),并在 GPT-2 和 LLaMA 预训练任务中达到或超过了 AdamW 和 Muon 的性能。

TL;DR

在深度学习预训练中,随着模型宽度(Width)的增加,学习率等关键超参数往往需要重新调优,这消耗了巨大的算力。本文提出的 MOGA (Matrix Operator Geometry Aware) 优化器通过引入均值归一化算子范数,从几何角度保证了网络损失函数的 Lipschitz 常数和平滑度不随宽度增加而恶化,从而实现了学习率在不同规模模型间的无缝迁移。

背景定位:为什么 scaling 不只是变大?

神经网络的 Scaling Laws 告诉我们“越大越强”,但在实践中,将 512 宽度的模型调好的学习率直接给 2048 宽度的模型,往往会导致不收敛。这是因为传统的优化几何(如 Euclidean 几何下的 Frobenius 范数)在多层非线性堆叠下,其“解析景观”会随维度发生剧变。

痛点深挖:算子范数的失效

作者发现,主流优化器如 SignSGD、AdamW 甚至最近兴起的 Muon,本质上都可以看作是某种**矩阵算子范数(Matrix Operator Norm)**下的最速下降法(Steepest Descent)。

然而,传统的 算子范数存在一个致命缺陷:层间不兼容性。当扰动通过多层网络传播时,层间的几何错配会导致 Lipschitz 常数呈爆炸式增长(与宽度 相关)。

核心贡献:均值归一化几何与 MOGA

为了解决这一问题,作者引入了均值归一化范数 (Mean-normalized Norms):

这个微小的改变(引入 因子)却带来了质变:它强制了连续层之间的范数兼容性(Compatibility Condition),使得 Lipschitz 边界变得宽度无关。

MOGA 优化器框架

基于此理论,MOGA 推导出了两种稳健的更新策略:

  1. 列归一化 (Column-wise):对应 几何。
  2. 行归一化 (Row-wise):对应 几何。

模型架构图 图 1:算子层间兼容性示意。只有均值归一化能保证稳定性在传播时不随维度坍缩或爆炸。

实验与结果:SOTA 级的迁移能力

1. 完美的学习率迁移

在 GPT-2 的缩放实验中,MOGA (行归一化版本) 展现了惊人的特性:从 Small (124M) 到 XL (1.5B),最优峰值学习率完全一致。这与 AdamW 在不同宽度下最优学习率剧烈波动的表现形成鲜明对比。

实验结果对比 图 2:在不同 值下,MOGA 在各规模模型上的 Loss 曲线最优值均指向同一学习率。

2. 长序列与低损耗场景的稳定性

在 LLaMA-130M 的训练中,当 Token 预算达到 Chinchilla 最优的 8 倍时,MOGA 的表现优于 Muon。作者指出,Muon 在 几何下的平滑度常数随深度以 增长,而 MOGA 的行归一化版本则能保持 的平滑度,这解释了其在训练后期的卓越稳定性。

深度洞察:优化与表达的权衡

文章最后讨论了一个深刻的问题:范数选得越“强”(如 ),优化越稳,但会限制模型的表达能力(Approximation Capacity)。

  • Muon:倾向于保留表达能力,但优化景观随宽度变陡。
  • 行归一化:在平滑度(优化易度)与约束(模型容量)之间找到了比前人更好的平衡点。

总结与局限性

MOGA 通过坚实的算子范数理论,为大模型的超参数调优提供了一条“一劳永逸”的道路。尽管该方法在 Transformer 上表现卓越,但在极其深层或包含复杂残差结构的架构中(如极端的深度缩放而非宽度缩放),其 Lipschitz 链式法则是否依然稳健仍值得进一步探索。

这项工作预示着,未来的优化器设计将不再是简单的“启发式调参”,而将全面转向几何感知 (Geometry-aware) 的系统工程。

发现相似论文

试试这些示例

  • 查找其他最近试图解决 Transformer 中大模型超参数迁移(Hyperparameter Transfer)或 $\mu$P 缩放问题的论文。
  • 哪篇论文最早讨论了矩阵算子范数在神经网络梯度归一化中的应用,本文提出的均值归一化与其有何本质区别?
  • 有哪些研究将行归一化(Row Normalization)或类似的二阶近似方法应用到了多模态模型或分布式大规模训练优化中?
目录
[arXiv 2026] MOGA 优化器:打破宽度缩放魔咒,实现完美超参数迁移
1. TL;DR
2. 背景定位:为什么 scaling 不只是变大?
3. 痛点深挖:算子范数的失效
4. 核心贡献:均值归一化几何与 MOGA
4.1. MOGA 优化器框架
5. 实验与结果:SOTA 级的迁移能力
5.1. 1. 完美的学习率迁移
5.2. 2. 长序列与低损耗场景的稳定性
6. 深度洞察:优化与表达的权衡
7. 总结与局限性