在 M1 Max 上本地執行 Kimi K3 研究:Deltafin 專案紀實
為何重要
這個極端的「存在性證明」精確地量化了 MoE 模型的邊緣部署門檻:在資源受限的硬體上,速度並非受 GPU 算力限制,而是被記憶體頻寬與碟須 I/O 瓶頸壓制。此實驗暗示未來輕量化產品若要端側執行超大模型,硬體記憶體(RAM)容量必須提升至能將 spine 資料常駐於頁快取的程度。
Deltafin 研究專案成功在規模僅 64GB RAM 的 Apple Silicon M1 Max 筆電上,透過 MoE 架構運行了總引數 2.8T 的 Kimi K3 模型,儘管推理速度緩慢,但證明瞭邊緣端部署超大模型的技術可行性。
- 硬體資源需求:K3 總權重約 1.56 TB,完整安裝需約 1.7 TB 硬碟空間;區域性運作時需要讀取約 114 GB 的 spine 資料、1.45 TB 的專家分佈。
- 效能表現:在 M1 Max 上全量推理約為 3.75 tokens/minute(16 秒/ token),前端 Prefill 若使用長系統提示會十分耗時,主要瓶頸在於每個 Token 重新讀取約 53 GB 的 resident spine。
- 推廣與相容性:專案提供無設定啟動與劃分為「流式安裝」(約 215GB)與「全量安裝」兩階段,並透過 shim 支援 OpenAI API 相容介面以供開發工具呼叫。