DeepSeek 發表 DeepSeek-V4.1-Flash,極致壓縮 KV 暫存記憶體耗量
為何重要
KV 快取 壓縮技術是實現長上下文模型商業化落地的關鍵軟體突破口。降低 HBM 與頻寬的資源需求,意味著可以在現有硬體上執行更複雜的推理任務,或顯著降低雲端推理的單位成本。DeepSeek 這次將 KV 足跡壓縮至原本 1/4 的規模,對於提升長時間任務的利潤率具有重要意義。
隨著長執行緒代理 的普及,模型運算負載轉向高輸入量型別,導致 KV 快取 對 HBM 與 SSD 的負擔成為部署的主要瓶頸。針對這在計算、儲存和頻寬上的限制,DeepSeek 發布名為 V4.1-Flash 的多模態 MoE 模型,專為代理工作負載的效能與成本最佳化設計。
- 支援長達 1 百萬 tokens 的上下文,並採用 Causal Encoder-Decoder (CED) 架構,分別在 decode 階段啟用 16B 引數、prefill 階段啟用 8B 引數。
- 結合 Compressed Sparse Attention 2 (CSA2) 與 FP4 快取技術,將全域 KV 快取 足跡 降至單 token 890 bytes,約為 V4-Flash 的 1/4。
- 匯入 SWA Bounded Replay 最佳化,將持久化 KV 快取 足跡 減少至 V4-Flash 版本的 1/8。
- 於 45T tokens 的多模態語料庫上進行預訓練與後訓練。