分組值注意力:透過按需鍵重建最佳化 Transformer KV 快取效率
為何重要
這項技術突破直接影響長上下文領域的推理效率與擴充套件性,提供一種在記憶體成本與模型準確率之間取得新平衡的解決方案。對於雲端供應商與企業部署者而言,這類快取壓縮技術有助於在不增加硬體資源的狀況下支援更長的序列長度。目前聲稱與 GQA 持平的準確率與大幅降低的快存需求,可能會成為未來架構最佳化的一個重要參考標竿。
為解決 Transformer 解碼中 KV 快取隨序列增長而導致的記憶體與流量瓶頸,研究提出「分組值注意力」技術,透過僅儲存分組值並利用學習到的線性對映在推論時重建鍵值。該方法以接近現有分組查詢注意力 (GQA) 的準確率,顯著減少了快取的潛存量。實驗在特定引數規模下驗證了其 44.18 的平均準確率,且已開發相關解碼 kernels 進行效能評估。
- 與 GQA 比較,GVA 將持久快取所需的標量減少了約 45-47%。
- 在 350M 引數、30B FineWeb-Edu tokens 的設定下,16 維位置變體的 5 項任務平均準確率為 44.18。
- 研究團隊已開發自訂解碼 kernels 測試端到端效能,並計畫近期開放原始碼。