Relax Within, Balance Across: 幾何引導的視覺-語言混合專家模型負載均衡
為何重要
此研究解決了 Vision-Language MoE 在處理變異輸入(如影像解析度或 tiling)時的負載過載問題,提供了一套可實作且不犧牲準確率的最佳化方法,對於需要在多模態場景下追求訓練穩定性的開發者具重要參考價值,屬於底層模型演算法的進步。
現行標準的 token-level Switch 輔助損失(Std-Aux)在視覺-語言混合專家模型中,僅能平衡混合載入,導致同一個 router 在不同影像解析度下呈現超過 5 倍的負載失衡變化。
- ReBA (Relax Within, Balance Across) 運用「Relax Within」與「Balance Across」兩種策略,在四種細分 backbone 上降低每一個報告基準輸入的載入,同時保持平均任務準確度與 Std-Aux 相當。
- 該方法透過「模態邊界」與「影像邊界」概念,將影像與文字分離條件路由,並針對每個影像設定獨立的等權重路由例項。
- ReBA 在測試範圍內降低平均載入,並有效減少最差實體載入(針對解析度與 tiling 變化的影響)。