Kimi Linear:具表現力且高效的注意力架構
為何重要
此技術直擊長上下文模型的高運算成本痛點,KV cache 減少與 6 倍解碼吞吐量的提升,對於雲端服務商及高頻繁使用長輸入的應用(如 Agent 與 RAG)具有顯著的成本優勢。作為開源架構,Kimi Linear 提供了繼 Transformer 之外另一種可落地的 HyFi(Hybrid Linear/Full Attention)解決方案。
Kimi Linear 推出混合線性注意力架構,聲稱在包含短/長上下文及強化學習等多種情境下,首次優於完整注意力。其核心 Kimi Delta Attention (KDA) 模組延展了 Gated DeltaNet,透過細粒度門控機制更有效運用有限狀態 RNN 記憶。
- 設計上採用 Diagonal-Plus-Low-Rank (DPLR) 過渡矩陣的專門變體,實現高硬體效率與計算量減少。
- 模型規模為 3B 啟用引數與 48B 總引數,基於 KDA 與 Multi-Head Latent Attention (MLA) 的層級混合構建。
- 實驗顯示在相同訓練配方下優於完整 MLA,KV cache 使用量最高降低 75%,1M 上下文長度的解碼吞吐量最高達到 6 倍。
- 作者同時開源 KDA kernel、vLLM 實作、預訓練及指令調整模型權重。