ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Fathom:針對 Offloaded KV Cache 的每查詢讀深度稀疏解碼技術

研究 1 個來源 · 6 天前
為何重要

針對 Host Memory offloading 情境下推論效率的最佳化是業界長期的痛點,Fathom 的 Per-Query 讀深度技術展示瞭如何在保留精確度的同顯著降低頻寬消耗。這對擴充套件 LLM agent、降低營運成本及最佳化 GPU 使用率具有直接的技術指導意義。

針對工作階段數百萬 tokens 且 KV cache 居於主機記憶體的情境,Fathom 提出一種 key scan 機制,讓每個查詢根據通道的重要性決定讀取深度,以減輕網路流量對解碼的瓶頸限制。

  • 在 Qwen3-8B 模型達到 1 百萬 tokens 時,單步解碼的 GPU 時間比 Double Sparsity、Loki 和 SparQ r=136 快 1.67 倍。
  • 在相當於 SparQ(r=16)的 GPU 時間內,Fathom 僅讀取 18% 更少的位元組,並在 7 個模型與上下文設定的 6 個中具有較低的 attention error。
  • 在真實編碼 agent 工作階段中,Fathom 可在 92 bits 下達到最準確 136-bit 掃描的步驟一致性。
FathomSparse DecodingKV CacheQwen3Efficiency

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00