DeepSeek-V4.1 Flash:極限壓縮 KV Cache 技術實驗報告
為何重要
這項技術突破直指當前多步驟 Agent 系統的關鍵痛點——長上下文的儲存成本與傳輸延遲。透過將 KV Cache 壓縮 4 倍並最佳化 KV 重用機制,DeepSeek 可能降低長序列推理的硬體門檻,使更多邊緣部署或低成本運算環境能夠承載複雜工作流程。此架構創新展現瞭如何在維持模型能力的前提下,大幅最佳化運算資源的跨領域應用價值。
DeepSeek 發布 V4.1 Flash 模型,透過架構創新將 KV Cache 壓縮量提升 4 倍,解決長情境 Agent 工作流程帶來的儲存與頻寬挑戰。
- 該模型總引數約 552B,原生支援 100 萬 tokens 上下文與多模態輸入,並透過活化引數差異最佳化(Prefill 啟用 8B、Decode 啟用 16B)來節省運算資源。
- 技術核心採用 CED(Causal Encoder-Decoder)架構以減少長序列 Pre-fill 運算,並透過 CSA2 採用 RoPE/NoPE、回退成防止過度複雜的結構等方式進行跨層儲存最佳化。
- 在維持高任務完成品質的同時,其執行時與持久化 KV Cache 空間分別僅為 DeepSeek-V4-Flash 的 1/4 與 1/8,並支援達到 420 Tokens/s 速度。