NVIDIA 推出 Transformer Engine 與 JAX 聯手加速 Dropless MoE 訓練
為何重要
這顯示對於訓練 DeepSeek-V3 等大型 MoE 模型的開發者而言,除了硬體價效比外,軟體棧的深度最佳化(如 Transformer Engine)將決定晶片能否發揮 10 倍的效能落差,直接影響昂貴的 GPU 叢集訓練成本。此成就證明 NVIDIA 能將高效能晶片(Blackwell)轉化為可為開發者帶來實質ROI(投資報酬率)的全棧解決方案,鞏固其企業 AI 佈局的軟體護城河。
NVIDIA 在技術部落格宣佈透過 NVIDIA Transformer Engine 結合 JAX 程式庫,在 NVIDIA GB200 與 GB300 硬體上實現了 Dropless MoE(無丟棄混合專家)訓練的巨大效能飛躍,有效解決了傳統 MoE 訓練中因專家 Token 數量不均而導致的算力浪費與通訊瓶頸。
- 在 GB200 硬體上,結合 Transformer Engine 的 JAX 實現了 10.4 倍的吞吐量提升,將 DeepSeek-V3 的效能從 103 TFLOPS/GPU 提升至 1,068 TFLOPS/GPU。
- 透過 NCCL EP(Expert Parallelism)與 XLA 多串流集合通訊,Transformer Engine 將分發與結合階段融合,並在 NVLink 和 InfiniBand 網路間疊加通訊以降低記憶體阻塞。
- 在訓練 DeepSeek-V3 671B 模型時,於 1,024 顆 GPU 的 GB300 NVL72 硬體上維持了 97% 的擴充套件效率。