ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

軟體工程任務評測更新:新增 13 款極致模型與 4 組 Agent,支援多程式語言分析

模型 1 個來源 · 5 天前
為何重要

此更新反映了 AI 在程式碼生成領域的競爭從單純的文本理解轉向「代理」能力與多語言工程場景的細緻評比。對開發者而言,更透明的成本與效能資料有助於在企業決策採用時,客觀評估模型在不改變既有工作流程下的 ROI(投資報酬率)。

一個評測程式碼撰寫與軟體工程任務的排行榜進行了大幅更新,新增了多款大型語言模型與具備代理程式能力的 AI 機器人,並提供更細緻的成本效能資料。

  • 新增評估模型:包含 DeepSeek-V4(Pro 與 Flash)、GLM 5.2、MiMo V2.5 Pro、Qwen3.6-35B-A3B 和 Gemma 4 31B 等共計 13 款模型,以及 4 組專門針對任務的 Agent。
  • 效能指標與功能增強:新增「Cached Tokens」欄位,並在 2025 年 7 月公開 Docker 映像與專屬 HuggingFace 資料集,用於重現評測任務。
  • 成本透明度:引入「Cost per Problem」與「Tokens per Problem」欄位,協助使用者評估解決單一程式問題所需的資源。
DeepSeekQwenGPT-5Claude OpusAgentSoftware Engineering

來源 · 1 篇報導

首發 Hacker News Front Page swe-rebench.com 23:28