MoE 強化學習中的專家空間探索研究
為何重要
這項發現證明瞭 MoE 架構中路由策略不僅影響計算路徑,還能作為額外的競爭優勢來源,改善模型的推理能力而不需增加額外的取樣或算力成本。對開發者而言,ESRL 提供了最佳化複雜模型基準(如數學、科學、程式碼)的有效訓練框架;對投資人來說,這顯示出基礎模型公司在微調與訓練效率上的技術迭代,可能影響日後應用層的競爭力與定價。
目前 MoE 模型的強化學習訓練多將專家路由視為固定元件,研究指出僅靠最佳化達成穩定性不夠,必須透過探索路由空間來增加 roll-out 多樣性。本研究提出 Expert-Space Exploration Reinforcement Learning (ESRL) 架構,透過將高信心專家當作錨點、依據路由器熵(router entropy)動態調整擾動強度,並在策略最佳化時重播專家路徑,緩解了直接擾動造成的路由不匹配。在 Qwen3-30B-A3B 的實務試驗中,ESRL 平均提升了 3.2%,平均 Pass@8 更提升了 4.5 個百分點。