ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ARCHead:基於活躍度度量的殘差校正大型語言模型輸出頭

研究 1 個來源 · 21 小時前
為何重要

ARCHead 解決了大模型推理成本中常被忽視的「輸出層」量化痛點,為權重量化技術提供了重要的補充。對開發者而言,這項技術在不犧牲顯著生產力(吞吐量)的前提下,額外壓縮了模型儲存空間,有利於邊緣部署與成本控制。

  • 權重量化雖能壓縮大型語言模型,但最終的語言建模 head 通常保留為 BF16 以避免誤差,ARCHead 提出一種壓縮方案,結合量化低秩核心與基於活躍度度量進行殘差校正。
  • 在 Qwen3-8B-Base 上,ARCHead 將儲存需求降至原頭部儲存的 25.6%,相對困惑度僅為 1.007;相比之下,儲存相同的原生 INT4 品質較差。
  • 與 AWQ 或 bitsandbytes 等後處理器結合時,ARCHead 的額外交叉熵誤差極小(約 0.006-0.007),且測量到的吞吐量變化低於 2%。
ARCHeadQwen3-8B-BaseWeight-only quantizationINT4LLM measurementresidual correction

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00