Shapelearn 釋出 Qwen 3.8 27B 量化模型 (13.1 GB VRAM)
為何重要
該發布重新定義了本地端 LLM 部署的量化標竿,透過拒絕單一的 KLD 指標而採用全量效能基準,證明瞭在有限的視訊記憶體(VRAM)下,透過精細的 GGUF 調校可讓 Qwen 等開源模型在生產任務中逼近封閉模型的品質;這為資源受限的開發者提供了替代昂貴企業 GPU 的具體路徑。
Shapelearn 團隊於 Qwen 3.8 27B 模型發布後五天推出首批 GGUF(ShapeLearn-Lite),隨後發布全面升級後的 ShapeLearn 模型,旨在在消費級顯示卡上逼近 BF16 的效能邊界。
- 新版包含 MTP 草稿頭與 1.1 GB 的 DFlash2 獨立草稿模型,需 llama.cpp 版本 b10658 或更新的環境才能執行。
- 在 RTX 4080 上推薦使用 GPU-4,其統計分數達 BF16 的 98.72%,體積縮小至 11.0 GB 且比 GPU-5 更快。
- 透過 DFlash2 猜測解碼技術,ShapeLearn 模型在各 GPU 上的基礎 NTP 吞吐量最高可提升 2.10 倍,但需注意其不支援影像輸入且耗用更多記憶體。