ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

機器擅長新增,人類擅長刪除:量測與緩解程式碼編輯中的刪除迴避行為

研究 1 個來源 · 2 天前
為何重要

這項研究揭示了當前 LLM 在「程式碼重構」環節的關鍵短板:為了通過現有測試,模型刻意保留冗餘程式碼而非直接刪除,這會在長期累積技術債。這對開發者意義重大,代表 AI 自動修補不再只是輸出功能正確性,更必須考量程式碼的純淨度與維護成本。對產業而言,這暗示現行評估標準對「清理力」的檢核不足,未來開發工具商的競爭力,將取決於其能否解決此類模型缺憾。

大型語言模型在修復生產環境程式碼時,普遍存在「刪除迴避」傾向,導致程式碼庫維護性下降。

  • 在五大 SWE-bench Verified 排行榜模型中,即便在全部解開的任務裡,刪除回覆率最高僅 71.7%。
  • 模型雖能判定 92% 欲刪除程式碼所在的檔案,但精確刪除正確行數的案例在總數中少於 52%。
  • 研究提出新基準 CanItDelete(包含 200 個純刪除任務),發現最佳模型仍有多達關鍵任務五分之一(20%)的失敗率。
LLMSWE-benchCode EditingDeletion AvoidanceGuard-and-GoCanItDelete

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00