憑藉 SSD 分散儲存串流執行 Kimi K3 (2.8T) 於 MacBook Pro
為何重要
這項技術展示了一種超越傳統 GPU 重度依賴的推理路徑,證明理論上可透過最佳化儲存與串流來執行大型 MoE 模型。對於開發者而言,這提供了一個在無需龐大雲端服務成本下測試完整模型輸出的工具;對產業而言,這反映了市場對於「AI 餓了嗎?」概念之外的硬體替代解決方案的探索,但目前仍受限於儲存 I/O 的瓶頸。
- 開源專案 Deltafin 在 MacBook Pro M1 Max 上利用 ARGODRIVE 儲存技術,成功串流執行完整的 2.8T 引數 Kimi K3 模型,基準吞吐量達 0.2901 token/s。
- 此實驗將原本官方指南所需的 16 節點、4.8 TB 總用的基礎設施目標,轉化為僅需約 1.5 萬美元的消費級硬體部署,而非官方建議的 200 萬美元級別。
- 該專案強調「純粹原始品質」,執行 Indiferact 的 Kimi-K3-DSpark(6.635 GB 硬碟載入)並開放 Qwen 加速加選,拒絕壓縮專家模型至 3-bit 以避免品質折損。