ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

AirLLM:在不降精度下讓 70B 模型在單張 4GB GPU 執行

工具 1 個來源 · 3 天前
為何重要

AirLLM 重新定義了小型 GPU 執行大型模型的技術邊界,讓開發者能以低成本於單卡環境驗證前沿模型的效能;這表明推論最佳化正成為與模型架構同等關鍵的戰場,將推動更多資源投入處理效率的競賽。

  • 70B Llama 僅需單張 4GB GPU 即可執行,且支援 405B Llama 3.1。- 支援 Kimi K3(2.8T)在 3.72GB VRAM 中執行,深搜 V3(671B)在約 12GB 運作。- 利用 Sparse MoE 架構的「專家流式載入」技術,取代傳統的量化與剪枝。- 支援 FP8 模型與 Block-wise Quantization (4bit/8bit) 壓縮,最高可提升 3 倍速度。
AirLLMKimi K3DeepSeek-V3MoELlama 3.1

來源 · 1 篇報導

首發 Hacker News Front Page github.com 19:15