Opus 5 長期程式碼維護測試:24% 通過率與高複雜度警告
為何重要
此評測現實地揭示了目前 LLM 在實際軟體工程生命週期管理中的侷限:即便模型表現看起來優越,在需要維護程式碼基座與排除回歸缺陷的長期任務中,模型仍無法「不插電」執行。這意味著自動化程式撰寫工具目前仍需強烈的人機協作,開發者不能僅依靠提升模型規格來解決複雜演進性程式的維護問題。
UW Madison 實驗室發布的 SlopCodeBench 是一項長期程式碼維護測評,旨在檢測模型在逐步揭露需求時程序式碼演進的能力,而非一次性解決完整問題。作者測試了 Opus 5 與前代的出力品質發現,Opus 5 雖取得 24% 的嚴格通過率(17 個 Checkpoints 中 4 則),其書寫的函式數量是 Opus 4.8 的五倍,且幾乎所有程式碼都觸發了「Slop」(冗長與複雜)警告。
- Opus 5 在
circuit_eval(easy)、database_migration(medium) 等三種難度組合的 17 個 Checkpoints 小型子集中,嚴格通過率為 24%(4 則正確)。 - 測試中包含的問題:
circuit_eval(8 checkpoints)、database_migration(5 checkpoints)、dynamic_config_service_api(4 checkpoints)。 - 雖然 Opus 5 表現最佳,但所有模型(包含 Opus 5)在絕對難度最高的問題上都無法達成全通過(Strict Pass)。
- Opus 5 單一挑戰期間撰寫的函式/可呼叫數量是 Opus 4.8 的五倍,顯示出顯著的程式碼冗餘。