ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

筆記本跑7000億引數GLM!無GPU也行? SSD當視訊記憶體用火爆GitHub

工具 1 個來源 · 1 小時前
為何重要

這項技術打破了大型模型執行必須配備高昂 GPU 視訊記憶體的慣性思維,證明軟體層的儲存架構最佳化 (Storage-tier optimization) 能成為硬體升級之外的關鍵路徑。這對邊緣端運算與預算有限的開發者極具影響力,且揭示了儲存裝置 (尤其是 NVMe SSD) 在未來 AI 基礎設施中可能扮演核心天線而非僅是輔助角色的趨勢,改變了關於模型部署成本與硬體需求的評估邏輯。

GitHub 專案 Colibrì 採取名為「AI memory multitiering」的分層推理架構,透過將 MoE 模型的非必要權重解除安裝至 SSD,實現了在低規格電腦上執行萬億引數模型,大幅降低執行門檻。

  • Colibrì 利用 JIT 概念,在 12 核 CPU + 25GB RAM 的基礎上即可執行 744B 引數的 GLM-5.2,官方最低建議 16GB RAM(推薦 24GB)。
  • 將 19456 個路由專家 (約 370GB int4 權重) 存於 SSD,僅將必要的 17B 啟用引數 (約 9.9GB) 啟用常駐 RAM,實現零 GPU 執行。
  • 支援多種模型如 GLM-5.2/5.3、DeepSeek V4 Flash、2.8T 的 Kimi K3,透過利用層間專家路由的 71.6% 可預測性進行預讀,速度可從 0.1 token/s 提升至 1.8 token/s (純 CPU)。
ColibrìGitHubGLM-5.2MoEDeepSeekSSD

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 17:01