超越幾何互補性:稀疏混合專家路由中的集中重疊
為何重要
這項研究顛覆了過去對 MoE 模型「互補性」的單一路徑理解,揭示了「集中重疊」的現象——模型並非透過嚴格正交的向量空間發揮作用,而是在共享的幾何鄰域內透過上下文路由來切割功能。 對於後續的基礎模型開發者與資料中心運維,這指出模型壓縮或光譜色散策略必須考量上下文依賴性,而非僅依賴幾何距離;這也推動了對 MoE 架構背後「路由機制」議題的更多研究需求。
這篇論文檢視稀疏混合專家模型的運作方式,質疑先前的「幾何互補性」假設,並透過專家子空間分離指數 (ESSI) 等方法,區分了路由一致性、候選者品質與上下文互動這三個概念。
- 在六種不同的 MoE 架構中,專家子空域存在顯著重疊,但實際路由比匹配的替代方案更能解釋 token 的表示。
- 研究涵蓋 OLMoE、Mixtral 和 DeepSeek 的 39 個因子細胞,結果顯示選定候選者的解釋力雖勝過最強未選競爭者,但字首語境反而削減了此優勢(所有互動均為負值,且 95% 信賴區間皆低於零)。
- 實驗證明幾何上的重疊不代表功能冗餘,在 39 組凍結路由比對中,加入後續專家在 24 組提升了下一 token 預測,證明多專家運算即使在非正交情況下仍具功能性。