密集型相對於 MoE 模型:活性引數、吞吐量與部署考量
為何重要
對開發者而言,這意味著 API 的產出速率與計算成本不再是單純取決於模型總引數量,而是取決於選用的架構與其吞吐量特性。這篇文章闡明瞭 NVIDIA 推出 Nemotron 系列而非單一巨型模型的策略邏輯,指出在追求「效能密度」的商業化推理市場中,MoE 構架具有獨特的競爭優勢。
NVIDIA 發布技術文章重點探討「密集型」 與「混合專家」 模型架構的差異,並以 Nemotron 3.5 Lightning 為例說明如何透過僅啟用少數引數來提升 Token 吞吐量,同時解耦記憶體預付成本與計算成本。
- Nemotron 3.5 Lightning 總引數達 30B,但在推理時每個 Token 僅啟用 3B 引數,藉此將運算焦點集中在必要權重上。
- 雖然 MoE 模型在總引數數量與 GPU 記憶體需求上與密集型模型相近,但它打破了記憶體與計算費用同步上升的限制,在批次大小為 1 的解碼情境下表現更佳。
- 對比例項顯示,Nemotron 3.5 Lightning 能以約 1/14 的價格提供 4 到 5 倍 Qwen3.8-27B 的輸出速度,但在一般能力評分上較為遜色。