ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

自託管 Kimi K3:硬體成本增加 20% 但任務解決率提升 20%

模型 1 個來源 · 8 天前
為何重要

隨著企業 AI 程式碼開支激增(出現 tokenmaxxing 現象),此研究凸顯了企業從公共 API 轉向自託管推理的關鍵決策點。文章透過具體的權過載入與並發測試資料,驗證了在犧牲 1/8 速度的前提下,本地模型在任務解決率上實現翻倍提升的可行性,這對追求成本效益與精確度的開發者團隊具有重要參考價值。

  • Kimi K3 擁有 1.4TB 權重,因記憶體不足無法部署於 8×B200 節點,需改用 8×B300 設定(每 GPU 288GB),導致硬體成本比 GLM-5.2 設定高出約 20%。
  • 在 16 個並發會話下,K3 的路徑聚合通量較低(122 tok/s),中位數任務時間較長(38 分鐘),整體速度約為 Claude Code 基準的 1/8。
  • 儘管速度較慢,K3 在 SEWBench Pro 測試中的任務解決率達 86.4%,顯著優於 GLM-5.2 和 Opus 4.8(後者僅 62.5%)。
KimiCoding AgentSelf-hostingSEWBench ProGPU 成本分析

來源 · 1 篇報導

首發 Hacker News Front Page aistack.imec-int.com 22:38