ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

LLaDA MoE v2:擴散語言模型的 MoE 架構擴充套件研究

研究 1 個來源 · 1 天前
為何重要

dLLM 作為 AR 模型的潛在替代方案,其擴充套件法則的確立有助於降低新架構的實驗成本;LLaDA MoE v2 顯示出潛在的訓練效率優勢(約 Qwen3 的 65% token 即達標),這對於追求效率的大廠具有高度技術參考價值。投資人與開發者應持續觀察此類新架構在後續 SFT 廣度及實際推理端延遲上的表現差異。

這項研究系統性地分析了擴散語言模型中專家混合 (MoE) 架構的擴充套件規律,與傳統自迴歸模型有所不同,並發表了新的設計準則。最佳化上,最佳批次大小隨算力增長更快,學習率則衰退更快;資源分配上,最優 Token 預算成長速度快於模型側運算;架構上,固定無效容量下規模越大越傾向更大的專家池。研究發表全新的 LLaDA MoE v2,為 30B 引數 / 3B 啟用引數的 dLLM,僅用 23.5T tokens(約為 Qwen3 的 65%)訓練,即在多項基準上逼近 Qwen3,且在僅經監督微調後便超越 SDAR Chat。

LLaDA MoE v2MoEDiffusion LLMQwen3Scaling Laws

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00