ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

超越幾何互補性:稀疏混合專家路由中的集中重疊

研究 1 個來源 · 6 天前
為何重要

這項研究顛覆了過去對 MoE 模型「互補性」的單一路徑理解,揭示了「集中重疊」的現象——模型並非透過嚴格正交的向量空間發揮作用,而是在共享的幾何鄰域內透過上下文路由來切割功能。 對於後續的基礎模型開發者與資料中心運維,這指出模型壓縮或光譜色散策略必須考量上下文依賴性,而非僅依賴幾何距離;這也推動了對 MoE 架構背後「路由機制」議題的更多研究需求。

這篇論文檢視稀疏混合專家模型的運作方式,質疑先前的「幾何互補性」假設,並透過專家子空間分離指數 (ESSI) 等方法,區分了路由一致性、候選者品質與上下文互動這三個概念。

  • 在六種不同的 MoE 架構中,專家子空域存在顯著重疊,但實際路由比匹配的替代方案更能解釋 token 的表示。
  • 研究涵蓋 OLMoE、Mixtral 和 DeepSeek 的 39 個因子細胞,結果顯示選定候選者的解釋力雖勝過最強未選競爭者,但字首語境反而削減了此優勢(所有互動均為負值,且 95% 信賴區間皆低於零)。
  • 實驗證明幾何上的重疊不代表功能冗餘,在 39 組凍結路由比對中,加入後續專家在 24 組提升了下一 token 預測,證明多專家運算即使在非正交情況下仍具功能性。
Sparse MoEMixtralDeepSeekOLMoERoutingESSI

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00