LLaDA MoE v2:擴散語言模型的 MoE 架構擴充套件研究
為何重要
dLLM 作為 AR 模型的潛在替代方案,其擴充套件法則的確立有助於降低新架構的實驗成本;LLaDA MoE v2 顯示出潛在的訓練效率優勢(約 Qwen3 的 65% token 即達標),這對於追求效率的大廠具有高度技術參考價值。投資人與開發者應持續觀察此類新架構在後續 SFT 廣度及實際推理端延遲上的表現差異。
這項研究系統性地分析了擴散語言模型中專家混合 (MoE) 架構的擴充套件規律,與傳統自迴歸模型有所不同,並發表了新的設計準則。最佳化上,最佳批次大小隨算力增長更快,學習率則衰退更快;資源分配上,最優 Token 預算成長速度快於模型側運算;架構上,固定無效容量下規模越大越傾向更大的專家池。研究發表全新的 LLaDA MoE v2,為 30B 引數 / 3B 啟用引數的 dLLM,僅用 23.5T tokens(約為 Qwen3 的 65%)訓練,即在多項基準上逼近 Qwen3,且在僅經監督微調後便超越 SDAR Chat。