[NVIDIA 技术报告] Megatron-Core MoE:攻克万亿参数训练的“三面墙”
Scalable Training of Mixture-of-Experts Models with Megatron Core
本文由 NVIDIA 发布,系统探讨了在 Megatron-Core 框架下训练超大规模专家混合模型(MoE)的技术细节。核心贡献是提出了多维并行策略、Parallel Folding 技术以及针对内存、通信和计算效率“三面墙”的深度优化,在 GB300 和 GB200 集群上实现了 DeepSeek-V3 等 SOTA 模型的高效训练。
TL;DR
NVIDIA 发布的这份技术报告详细阐述了如何在 Megatron-Core 中实现 MoE 模型的高性能训练。其核心在于通过 Parallel Folding 解决并行冲突,并利用 DeepEP/HybridEP 调度器和 FP8/FP4 精度突破显存、通信与计算效率的瓶颈。在 Blackwell 架构(GB300)上,该框架能将 DeepSeek-V3 的训练效能推向极致。
1. 痛点:稀疏性带来的“并行悖论”
在稠密模型(Dense Model)中,计算量与参数量是线性耦合的。但 MoE 模型打破了这一平衡:
- 显存墙:需要存储数千亿甚至万亿参数,但每 token 激活的计算量极小。
- 通信墙:专家并行(EP)引入的全对全(All-to-all)通信在跨节点时带宽受限,甚至占据总耗时的 60%。
- 效率墙:细粒度专家导致小 GEMM 频发,无法饱和 GPU 算力;动态路由导致的 host-device 同步使 CPU 成为瓶颈。
2. Methodology:解耦与重构并行空间
2.1 Parallel Folding (并行折叠)
报告最具洞察力的点在于指出:注意力层(Dense)和专家层(Sparse)对并行的诉求是冲突的。 注意力层需要高 TP/CP 处理长序列,而专家层需要高 EP 避免权重碎片化。
Megatron-Core 通过 Parallel Folding 实现了两者的解耦,允许 EP 在 TP×CP 组内“折叠”,极大降低了最小 GPU 起算门槛(例如将 64 卡需求降至 8 卡)。

2.2 击破“通信墙”:DeepEP 与 1F1B 重叠
针对 All-to-all 通信瓶颈,框架引入了负载感知调度。特别是 Merged FWD-BWD 方案,将 micro-batch 的前向通信与后向计算重叠,使得跨节点通信几乎不再拖慢流水线。
3. 针对 Blackwell 架构的极限优化:FP4 与 CUDA Graphs
在 GB200/GB300 上,CPU 延迟成为了性能杀手。报告提出了 Sync-Free MoE:
- 设备触发内核:由 GPU 直接读取路由形状,无需同步回 CPU。
- Paged Stashing:通过分页管理解决 CUDA Graphs 对静态内存的要求,内存碎片大幅减少。
- NVFP4 精度:Blackwell 原生支持的 FP4 训练,不仅减少了 75% 的激活显存,更翻倍了 Tensor Core 的吞吐速度。

4. 实验结论:SOTA 性能的工程落地
在 1024 块 H100 上的 DeepSeek-V3 跑分显示,FP8 结合 DeepEP 实现了 368 TFLOPS/GPU 的高吞吐。而在 Blackwell 平台上,由于 NVLink-C2C 的高带宽,吞吐量提升了近 3 倍。
5. 深度洞察与总结
这份报告标志着大规模 MoE 训练进入了“系统级微操”时代。
- 局限性:尽管优化了通信,但当序列长度极长(>128K)时,Attention 的 复杂度依然会取代 MoE 成为主导瓶颈。
- 启示:硬件拓扑(如 NVL72)与软件调度策略的深度绑定,将是未来长文本、大容量模型训练的唯一出路。
Takeaway: Megatron-Core MoE 不仅仅是一个库,它定义了一套应对“参数暴涨、算力紧缩”挑战的工业标准。
