自託管 Kimi K3:硬體成本增加 20% 但任務解決率提升 20%
為何重要
隨著企業 AI 程式碼開支激增(出現 tokenmaxxing 現象),此研究凸顯了企業從公共 API 轉向自託管推理的關鍵決策點。文章透過具體的權過載入與並發測試資料,驗證了在犧牲 1/8 速度的前提下,本地模型在任務解決率上實現翻倍提升的可行性,這對追求成本效益與精確度的開發者團隊具有重要參考價值。
- Kimi K3 擁有 1.4TB 權重,因記憶體不足無法部署於 8×B200 節點,需改用 8×B300 設定(每 GPU 288GB),導致硬體成本比 GLM-5.2 設定高出約 20%。
- 在 16 個並發會話下,K3 的路徑聚合通量較低(122 tok/s),中位數任務時間較長(38 分鐘),整體速度約為 Claude Code 基準的 1/8。
- 儘管速度較慢,K3 在 SEWBench Pro 測試中的任務解決率達 86.4%,顯著優於 GLM-5.2 和 Opus 4.8(後者僅 62.5%)。