BeaconKV:基於信標查詢導向的鍵值快取壓縮技術,用於高效能大型推理模型推論
為何重要
大型推理模型的部署門檻在於記憶體瓶頸,BeaconKV 提供了一種不依賴額外訓練即可顯著降低推理成本的方法。它解決了現有壓縮演算法在處理長視窗歸納與反思時的盲點,透過提高 4.3 倍吞吐量與壓縮 5.8 倍記憶體,為雲服務與邊緣部署這類重運算場景提供了實質的效能解決方案。
大型推理模型(LRMs)透過長鏈式思考解決難題,卻導致 KV 快取與序列長度同步增長,造成 GPU 記憶體瓶頸。現有壓縮方法假定近期查詢能預測未來注意力模式,卻忽略了模型會產生「思想回顧 Token」(TRT)重新關注早期計畫的行為。BeaconKV 發現這些 TRT 查詢在嵌入空間會聚整合少數群組,進而提出維護「信標查詢」以預測回顧行為。測試顯示,在四個開源模型上,該方法優於現有技術,達成最高 5.8 倍記憶體減少、近乎完整的快取準確度,以及超過 4.3 倍的吞吐量提升。
- BeaconKV 技術特性:作為「免訓練」解法,利用查詢在嵌入空間的相似群組構成,維護「信標查詢」來預測未來將回顧的 KV 對,而解決了傳統方法無法捕捉長期回顧邏輯的缺陷。
- 影響現有方法的盲點:現有壓縮方法隱含假設近期待查詢可靠,但 BeaconKV 指出在長期推理中,模型會重新關注早期的任務計畫,導致原本的預測失效。
- 效能優勢資料:在四個開源 LRM 和多項基準測試中,BeaconKV 實現了高達 5.8 倍的記憶體減少,幾乎保留了完整的快取準確性,並將吞吐量提升超過 4.3 倍。