Fathom:針對 Offloaded KV Cache 的每查詢讀深度稀疏解碼技術
為何重要
針對 Host Memory offloading 情境下推論效率的最佳化是業界長期的痛點,Fathom 的 Per-Query 讀深度技術展示瞭如何在保留精確度的同顯著降低頻寬消耗。這對擴充套件 LLM agent、降低營運成本及最佳化 GPU 使用率具有直接的技術指導意義。
針對工作階段數百萬 tokens 且 KV cache 居於主機記憶體的情境,Fathom 提出一種 key scan 機制,讓每個查詢根據通道的重要性決定讀取深度,以減輕網路流量對解碼的瓶頸限制。
- 在 Qwen3-8B 模型達到 1 百萬 tokens 時,單步解碼的 GPU 時間比 Double Sparsity、Loki 和 SparQ r=136 快 1.67 倍。
- 在相當於 SparQ(r=16)的 GPU 時間內,Fathom 僅讀取 18% 更少的位元組,並在 7 個模型與上下文設定的 6 個中具有較低的 attention error。
- 在真實編碼 agent 工作階段中,Fathom 可在 92 bits 下達到最準確 136-bit 掃描的步驟一致性。