ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

解開記憶體牆:Edge0 引擎利用預測路由將 35B MoE 模型部署於 SSD

工具 1 個來源 · 6 天前
為何重要

Edge0 透過軟體最佳化技術解決了在消費級硬體上部署複雜 MoE 模型的關鍵限製,讓原本受限於「記憶體牆」的大型前線模型能夠在有限的消費級卡上執行。這改變了中小企業或個人開發者部署 AI 的硬體門檻,推動從昂貴伺服器向本地化、輕量化硬體部署的趨勢。

MoE 推理常受制於權重記憶體,簡單的 SSD 預載因時序問題難以消除瓶頸;Edge0 透過預測下一層路由解決此事,使預取的專家集合與實際路由一致。

  • Edge0 引擎引入預路由器,透過預測下一層的路由來消除消費級硬體上的記憶體牆問題。
  • 在單一 24GB 記憶體機器上,該引擎以 20 tokens/s 速度執行 35B MoE 模型,且僅佔用約 3GiB 峰值活躍記憶體。
  • 專案透過 LoRA 技術恢復 int4 量化造成的品質損失,在五個公開基準測試中平均效能逼近 fp16 教師模型。
  • 框架、檢查點及介面卡均為開源,且支援 8B 量級模型。
Edge0MoEMixture-of-ExpertsEdge InferenceSSDLoRA

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00