ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Kimi K3 發布:代理工作評測僅次 Fable 5,但單任務成本與耗時偏高

模型 1 個來源 · 15 天前
為何重要

Kimi K3 的資料證實了「知識代理能力」評測的嚴苛性:高分不代表低成本與高效率。標語「低廉智力的價格崩盤」背後,實際上是採取特定策略(高昂成本與低 API 速度)來換取最高評分。對於開發者而言,這打醒了「只要模型分數夠高就能出貨」的迷思,實務中的推理成本與延遲才是商業化關鍵。

Moonshot AI 發布引數量達 2.8T 的新一代 Kimi K3 模型,在 Artificial Analysis Intelligence Index 上表現與 Opus 4.8 及 GPT-5.5 相當。

  • 在 AA-Briefcase 基準測試中,K3 得分 Elo 僅次於 Claude Fable 5 (1574),較前代 K2.6 提升 727 分。
  • 雖分析能力強勁 (Elo 1754),但演示呈現較弱 (Elo 1471),且必須依靠首方 API 執行。
  • K3 平均每個任務成本 $10.57,耗時 56.4 分鐘,顯著高於 GPT-5.6 Sol 和 Claude Fable 5。
Moonshot AIKimi K3AA-BriefcaseBenchmarkOpen Weights rumors

來源 · 1 篇報導

首發 Hacker News Front Page artificialanalysis.ai 12:33