SLAI T-Rex:基於昇騰 SuperPOD 的 DeepSeek-V4 系列全引數後訓練最佳化實踐
為何重要
本項研究具體證明,即便使用非 NVIDIA 架構的昇騰 SuperPOD,透過層級化軟體最佳化仍能將 MoE 模型訓練效率提升數倍,展現了中國本土 AI 硬體生態在軟體層的硬實力。DeepSeek-V4-Flash 在數學運籌任務上的領先表現,直接挑戰 GPT-5.4-Mini 的論文地位,重啟了閉源 vs 開源模型在基礎推理能力上的競賽。
為瞭解決兆引數級 MoE 模型在昇騰 NPU SuperPOD 訓練時的記憶體壓力與通訊瓶頸,研究團隊提出 SLAI T-Rex 全棧最佳化架構,實現了系統層級的效率提升。
- 在昇騰 SuperPOD 上訓練 DeepSeek-V4 家族,達到 34.22% 的 Model FLOPs Utilization (MFU),相較開源基準配方提升 2.93 倍。
- 建立了面向 Operations Research (OR) 任務的自然語言推理工作流程(CPT 與 SFT),並建構了包含 10K 高品質樣本的專屬資料集。
- DeepSeek-V4-Flash 專用模型在 Zero-shot Pass@1 測試中拿下 71.81%,超越 GPT-5.4-Mini 3.98 個百分點。