ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SLAI T-Rex:基於昇騰 SuperPOD 的 DeepSeek-V4 系列全引數後訓練最佳化實踐

中國 1 個來源 · 14 天前
為何重要

本項研究具體證明,即便使用非 NVIDIA 架構的昇騰 SuperPOD,透過層級化軟體最佳化仍能將 MoE 模型訓練效率提升數倍,展現了中國本土 AI 硬體生態在軟體層的硬實力。DeepSeek-V4-Flash 在數學運籌任務上的領先表現,直接挑戰 GPT-5.4-Mini 的論文地位,重啟了閉源 vs 開源模型在基礎推理能力上的競賽。

為瞭解決兆引數級 MoE 模型在昇騰 NPU SuperPOD 訓練時的記憶體壓力與通訊瓶頸,研究團隊提出 SLAI T-Rex 全棧最佳化架構,實現了系統層級的效率提升。

  • 在昇騰 SuperPOD 上訓練 DeepSeek-V4 家族,達到 34.22% 的 Model FLOPs Utilization (MFU),相較開源基準配方提升 2.93 倍。
  • 建立了面向 Operations Research (OR) 任務的自然語言推理工作流程(CPT 與 SFT),並建構了包含 10K 高品質樣本的專屬資料集。
  • DeepSeek-V4-Flash 專用模型在 Zero-shot Pass@1 測試中拿下 71.81%,超越 GPT-5.4-Mini 3.98 個百分點。
DeepSeek-V4SLAI T-RexAscendMoEOperations Research

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00