混合專家模型的記憶體效率最佳化:研究提出 SkewAdam 根據引數群體特徵分層分配最佳化器狀態
為何重要
這項工作顛覆了「壓縮越少越安全」的直覺,證明針對不同引數群體(如 Router 與 Experts)採取差異化的狀態分配策略,是實現記憶體效率的核心,而非單純的通用壓縮。對產業而言,這意味著訓練大型 MoE 模型時,未必必須投入昂貴的 80GB GPU 顯示卡,透過合理的最佳化器配置即可在 40GB 顯示卡上安全落點;同時,研究確認 Momentum 是維持精度的關鍵因素,引導未來硬體與軟體堆疊的最佳化方向。
混合專家 訓練中 Optimizer state 耗記憶體嚴重,是限制模型規模的主要瓶頸。本研究提出 SkewAdam 策略,根據 dense backbone、Experts 與 Router 三類引數的規模與梯度統計差異,分配不同精度的最佳化器狀態。