AirLLM:在不降精度下讓 70B 模型在單張 4GB GPU 執行
為何重要
AirLLM 重新定義了小型 GPU 執行大型模型的技術邊界,讓開發者能以低成本於單卡環境驗證前沿模型的效能;這表明推論最佳化正成為與模型架構同等關鍵的戰場,將推動更多資源投入處理效率的競賽。
- 70B Llama 僅需單張 4GB GPU 即可執行,且支援 405B Llama 3.1。- 支援 Kimi K3(2.8T)在 3.72GB VRAM 中執行,深搜 V3(671B)在約 12GB 運作。- 利用 Sparse MoE 架構的「專家流式載入」技術,取代傳統的量化與剪枝。- 支援 FP8 模型與 Block-wise Quantization (4bit/8bit) 壓縮,最高可提升 3 倍速度。