Cognition 發布 SWE-2:2.8T 引數 MoE 模型在 Terminal-Bench 2.1 取得滿分級表現
為何重要
Cognition透過後訓練和 MOE 模型證明即使不擴張模型權重大小,仍有機會在 Skill-Specific(專精任務)的指標上擊敗甚至趕上 GPT-6 與 Claude Opus 等巨頭,這對於營收壓力的 AI 初創公司極具示範意義。 然而 Terminal-Bench 4.0 的表現揭示了當前具體化 Agent 在長距離規劃上的致命短板,這是 GPT-6 等前緣模型尚未完全補足的技術缺口。 對於投資人和產業而言,這顯示了「模型堆疊」的重要性提高——透過 Speculative Decoding 和特定 Kernel(如 FP8)的調校,單位吞吐量的軟體價值在當前硬體供應有限下,將直接決定 end-to-end(端到端)的競爭力。
- 模型規格與技術: SWE-2 為 2.8T 引數的 MoE 混合專家模型,源自 Kimi K3 基底,採用 Cognition 的後訓練與強化學習,首次將 RL 放入兆級引數規模。
- 關鍵 Benchmark 距離: 在 Terminal-Bench 2.1 拿下 92.8 分,為目前最高;但在 Terminal-Bench 4.0 上分數僅 27.3,顯著落後於 GPT-6 Astra (57.9) 與 Claude Fable 5.1 (55.8)。
- 成本與效率優勢: 儘管在 FrontierCode 1.1 Main 落後 GPT-6 Astra 3.3 分,Cognition 宣稱其成本僅為 Astra 的 25% 與 Fable 5.1 的 64%;平均執行步數 53 步,首次編輯僅需 18 步。
- 產品發布現狀: 目前僅於 Devin Desktop 與 CLI 上領先推出,未公開 API 端點亦無開源權重,無法進行在地端或公開定價驗證。