SWE-Touch:當使用者介入程式碼環境時,評估編寫代理的協作準則
為何重要
目前的編碼代理在單純的模擬作業中常屢創新高,但 SWE-Touch 顯示出代理在面對人類不確定介入時的脆弱性。對於開發者與業者而言,這意味著現有的 Agent 開發工具在全球部署時,其可靠性的最主要阻礙並非模型智力,而是如何管理「人機協作」過程中的同步與衝突。
文章提出 SWE-Touch 框架,旨在模擬現實開發中使用者介入程式碼的情境,測試編寫代理在共享工作區的狀態感知與回應能力。
- 評估涵蓋九個編碼模型,並透過注入經驗證的「Counter-Edits」來壓力測試代理的穩定性。
- 結果顯示,這種幹預導致 SWE-bench Verified 上的平均解析率降低了 7.7 個百分點。
- 失敗分析歸因於代理缺乏對演變中工作區的足夠狀態感知,可能產生衝突或不正確的修復。