ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SWE-Touch:當使用者介入程式碼環境時,評估編寫代理的協作準則

研究 1 個來源 · 2 天前
為何重要

目前的編碼代理在單純的模擬作業中常屢創新高,但 SWE-Touch 顯示出代理在面對人類不確定介入時的脆弱性。對於開發者與業者而言,這意味著現有的 Agent 開發工具在全球部署時,其可靠性的最主要阻礙並非模型智力,而是如何管理「人機協作」過程中的同步與衝突。

文章提出 SWE-Touch 框架,旨在模擬現實開發中使用者介入程式碼的情境,測試編寫代理在共享工作區的狀態感知與回應能力。

  • 評估涵蓋九個編碼模型,並透過注入經驗證的「Counter-Edits」來壓力測試代理的穩定性。
  • 結果顯示,這種幹預導致 SWE-bench Verified 上的平均解析率降低了 7.7 個百分點。
  • 失敗分析歸因於代理缺乏對演變中工作區的足夠狀態感知,可能產生衝突或不正確的修復。
SWE-TouchSWE-benchCoding Agents人機協作Benchmark

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00