ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Opus 5 長期程式碼維護測試:24% 通過率與高複雜度警告

研究 1 個來源 · 9 天前
為何重要

此評測現實地揭示了目前 LLM 在實際軟體工程生命週期管理中的侷限:即便模型表現看起來優越,在需要維護程式碼基座與排除回歸缺陷的長期任務中,模型仍無法「不插電」執行。這意味著自動化程式撰寫工具目前仍需強烈的人機協作,開發者不能僅依靠提升模型規格來解決複雜演進性程式的維護問題。

UW Madison 實驗室發布的 SlopCodeBench 是一項長期程式碼維護測評,旨在檢測模型在逐步揭露需求時程序式碼演進的能力,而非一次性解決完整問題。作者測試了 Opus 5 與前代的出力品質發現,Opus 5 雖取得 24% 的嚴格通過率(17 個 Checkpoints 中 4 則),其書寫的函式數量是 Opus 4.8 的五倍,且幾乎所有程式碼都觸發了「Slop」(冗長與複雜)警告。

  • Opus 5 在 circuit_eval (easy)、database_migration (medium) 等三種難度組合的 17 個 Checkpoints 小型子集中,嚴格通過率為 24%(4 則正確)。
  • 測試中包含的問題:circuit_eval (8 checkpoints)、database_migration (5 checkpoints)、dynamic_config_service_api (4 checkpoints)。
  • 雖然 Opus 5 表現最佳,但所有模型(包含 Opus 5)在絕對難度最高的問題上都無法達成全通過(Strict Pass)。
  • Opus 5 單一挑戰期間撰寫的函式/可呼叫數量是 Opus 4.8 的五倍,顯示出顯著的程式碼冗餘。
Opus 5ClaudeSlopCodeBenchcode qualitycoding benchmark

來源 · 1 篇報導

首發 Hacker News Front Page github.com 06:37