ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

IntBMoE:將區塊級條件化整合進專家組成的全參與高容量 Mixture-of-Experts 模型

研究 1 個來源 · 2 天前
為何重要

傳統 MoE 架構常難以兼顧推理速度與模型引數規模,IntBMoE 的解耦設計提供了向前邁進的關鍵技術路徑。AMap 的實際匯入案例──在 6000 萬使用者規模與極嚴苛 60ms SLA 下應用於導航場景──證實了高參與度架構商業落地的可行性,這對追求高密度資料輸出的變現型 AI 應用具有強烈的指標意義。

核心背景

Mixture-of-Experts (MoE) 模型雖然提升了模型容量,但以往設計無法獨立控制「參與度」、「執行計算量」與「記憶體佔用」三項指標。IntBMoE 透過稀疏區塊執行搭配稠密專家組合的設計,成功解耦了這三者,讓模型既能保持全參與度,又能限制計算成本。

  • IntBMoE 引入輕量級超網路與學習到的 codebook,將網路層池中的所有專家基礎模型合併為單一專家,並利用 DPRG(Dual-Path Residual Gating)耦合兩個獨立組成的路徑。
  • 實驗結果顯示,該架構相較於代表性 sparse 和 dense MoE 基準模型,在影像分類、語言建模以及序列推薦任務中均一致地帶來效能提升。
  • 技術已在 AMap 的生成式推薦系統中產品化,在 60ms 的延遲預算內支援數億級使用者,並線上上 A/B 測試中實現了 2.4% 的相對 UVCTR 增益。
IntBMoEMoEAMapDPRGhypernetworkDreamX-Rec

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00