HyQuant:用於大型語言模型注視機制的混合精確度量化研究
為何重要
HyQuant 解決了指數縮減注意力模組位元數時的準確度困境,為追求更高運算效率的 LLM 工程師提供了一個可落地的混合精度解法。對於資料中心與邊緣運算市場,該技術透過 KV-cache 壓縮與運算融合,展示了在不顯著犧牲輸出品質的前提下降低推理成本與記憶體佔用的潛力。
由於現有低位元量化技術在處理注意力機制時容易造成效能下降,研究團隊提出 HyQuant 架構以改善此問題。該方法將大多數注視狀態量化為低位元,並保留少數高精確度的「垂直線 tokens」與「本地視窗狀態」。它利用輕量級的「垂直線感知注視模式訊號」來選擇這些關鍵區域。在實作上,系統於預填充 階段保持特定區域的完整精度,並於解碼 階段融合 KV-cache 壓縮與解量化運算,在多項任務與資料集上均維持了近乎無損的準確度。