演進與架構解析:旗艦級開源模型 Kimi K3 現身
為何重要
K3 的架構顯示出前線層模型競賽已從單純追求引數規模轉向「運算效率」的整合(如 LatentMoE 與 NoPE),直接對標 DeepSeek V4 與 NVIDIA 的路線。 對開發者而言,這提供了除 DeepSeek 以外另一個具備多模支援的高門檻本地部署基準。 這也反映出在中國本土,Moonshot AI 正在構建一條緊扣國際主流硬體最佳化趨勢卻又保有獨特性的技術基地。
Kimi K3 是昨日發布的重大開源權重模型,延續自去年的 Kimi Linear 並大幅擴大規模,引入已驗證的 LatentMoE 與新的注意力機制以提升推理效率。
- 規模與定位:引數量從 48B 增大為 2.8T,是目前最大的開放權重模型。
- 技術元件:採用與 NVIDIA Nemotron 3 Ultra 相同的 LatentMoE,並整合 Kimi Delta Attention。
- 位置編碼:全域移除 RoPE,改用 NoPE(No Positional Embeddings)架構。
- 成本與效能:引入 Attention Residuals 改善殘差路徑,使訓練成本增加約 4%、推論成本增加約 2%。