ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Shapelearn 釋出 Qwen 3.8 27B 量化模型 (13.1 GB VRAM)

工具 1 個來源 · 5 天前
為何重要

該發布重新定義了本地端 LLM 部署的量化標竿,透過拒絕單一的 KLD 指標而採用全量效能基準,證明瞭在有限的視訊記憶體(VRAM)下,透過精細的 GGUF 調校可讓 Qwen 等開源模型在生產任務中逼近封閉模型的品質;這為資源受限的開發者提供了替代昂貴企業 GPU 的具體路徑。

Shapelearn 團隊於 Qwen 3.8 27B 模型發布後五天推出首批 GGUF(ShapeLearn-Lite),隨後發布全面升級後的 ShapeLearn 模型,旨在在消費級顯示卡上逼近 BF16 的效能邊界。

  • 新版包含 MTP 草稿頭與 1.1 GB 的 DFlash2 獨立草稿模型,需 llama.cpp 版本 b10658 或更新的環境才能執行。
  • 在 RTX 4080 上推薦使用 GPU-4,其統計分數達 BF16 的 98.72%,體積縮小至 11.0 GB 且比 GPU-5 更快。
  • 透過 DFlash2 猜測解碼技術,ShapeLearn 模型在各 GPU 上的基礎 NTP 吞吐量最高可提升 2.10 倍,但需注意其不支援影像輸入且耗用更多記憶體。
Qwen 3.8 27BShapeLearnGGUFQuantizationllama.cppDFlash2

來源 · 1 篇報導

首發 Hacker News Front Page byteshape.com 10:04