ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Qwen3.8 27B 量化測試:4-bit 品質維持,1-bit 效能崩潰

模型 1 個來源 · 15 天前
為何重要

這項實測證實 4-bit 量化足以消弭消費級硬體部署前沿模型(Frontier Model)的記憶體門檻,讓 RTX 4090 等顯示卡能跑出接近原版的前沿表現。 - 對開發者而言,1-bit 量化失敗的極端案例提供了重要防線:開發與部署時必須將「推理軟體/硬體搭配」視為核心議題,而非僅追求壓縮比率。 - 從商業落地上看,若 Qwen 這類前沿模型能透過 4-bit 減少三分之二記憶體佔用,將直接推動本地 AI Agent 與邊緣運算部署的普及。

測試作者對比了全精度(BF16)與 Unsloth 量化的 Qwen3.8 27B 模型,探討在壓縮過程中水準維持的情況。

  • 全模型 BF16 重量為 55 GB,而 4-bit 量化版(Q4_K_M)僅重 17 GB,仍能在 Terminal-Bench 2.1 基準上保留原版表現並適用於 RTX 4090。
  • 2-bit 量化(UD-Q2_K_XL)在效能上僅略有下降,但 1-bit 量化模型在 GPQA Diamond 等複雜基準測試上的表現退化至接近隨機猜測。
  • 作者在 Modal 上租用 NVIDIA L40S、H100 等 GPU 進行測試,發現 1-bit 量化在長鏈推理時會出現回傳空答案的情況。
Qwen3.8Unsloth4-bitTerminal-Bench 2.1GPQA Diamond

來源 · 1 篇報導

首發 Hacker News Front Page quesma.com 22:49