ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

DeepSeek-V4.1 Flash:極限壓縮 KV Cache 技術實驗報告

研究 1 個來源 · 6 天前
為何重要

這項技術突破直指當前多步驟 Agent 系統的關鍵痛點——長上下文的儲存成本與傳輸延遲。透過將 KV Cache 壓縮 4 倍並最佳化 KV 重用機制,DeepSeek 可能降低長序列推理的硬體門檻,使更多邊緣部署或低成本運算環境能夠承載複雜工作流程。此架構創新展現瞭如何在維持模型能力的前提下,大幅最佳化運算資源的跨領域應用價值。

DeepSeek 發布 V4.1 Flash 模型,透過架構創新將 KV Cache 壓縮量提升 4 倍,解決長情境 Agent 工作流程帶來的儲存與頻寬挑戰。

  • 該模型總引數約 552B,原生支援 100 萬 tokens 上下文與多模態輸入,並透過活化引數差異最佳化(Prefill 啟用 8B、Decode 啟用 16B)來節省運算資源。
  • 技術核心採用 CED(Causal Encoder-Decoder)架構以減少長序列 Pre-fill 運算,並透過 CSA2 採用 RoPE/NoPE、回退成防止過度複雜的結構等方式進行跨層儲存最佳化。
  • 在維持高任務完成品質的同時,其執行時與持久化 KV Cache 空間分別僅為 DeepSeek-V4-Flash 的 1/4 與 1/8,並支援達到 420 Tokens/s 速度。
DeepSeekV4.1KV CacheMoECEDAgent

來源 · 1 篇報導

首發 Hacker News Front Page zartbot.github.io 09:39