解開記憶體牆:Edge0 引擎利用預測路由將 35B MoE 模型部署於 SSD
為何重要
Edge0 透過軟體最佳化技術解決了在消費級硬體上部署複雜 MoE 模型的關鍵限製,讓原本受限於「記憶體牆」的大型前線模型能夠在有限的消費級卡上執行。這改變了中小企業或個人開發者部署 AI 的硬體門檻,推動從昂貴伺服器向本地化、輕量化硬體部署的趨勢。
MoE 推理常受制於權重記憶體,簡單的 SSD 預載因時序問題難以消除瓶頸;Edge0 透過預測下一層路由解決此事,使預取的專家集合與實際路由一致。
- Edge0 引擎引入預路由器,透過預測下一層的路由來消除消費級硬體上的記憶體牆問題。
- 在單一 24GB 記憶體機器上,該引擎以 20 tokens/s 速度執行 35B MoE 模型,且僅佔用約 3GiB 峰值活躍記憶體。
- 專案透過 LoRA 技術恢復 int4 量化造成的品質損失,在五個公開基準測試中平均效能逼近 fp16 教師模型。
- 框架、檢查點及介面卡均為開源,且支援 8B 量級模型。