ARCHead:基於活躍度度量的殘差校正大型語言模型輸出頭
為何重要
ARCHead 解決了大模型推理成本中常被忽視的「輸出層」量化痛點,為權重量化技術提供了重要的補充。對開發者而言,這項技術在不犧牲顯著生產力(吞吐量)的前提下,額外壓縮了模型儲存空間,有利於邊緣部署與成本控制。
- 權重量化雖能壓縮大型語言模型,但最終的語言建模 head 通常保留為 BF16 以避免誤差,ARCHead 提出一種壓縮方案,結合量化低秩核心與基於活躍度度量進行殘差校正。
- 在 Qwen3-8B-Base 上,ARCHead 將儲存需求降至原頭部儲存的 25.6%,相對困惑度僅為 1.007;相比之下,儲存相同的原生 INT4 品質較差。
- 與 AWQ 或 bitsandbytes 等後處理器結合時,ARCHead 的額外交叉熵誤差極小(約 0.006-0.007),且測量到的吞吐量變化低於 2%。