Agent Retrieval Bench:評估程式碼代理的儲存庫上下文檢索能力
為何重要
這項研究揭示了當前編碼 AI(Agent)「華麗的回應能力」背後潛藏的技術盲點:高達三成的檢索失敗率嚴重阻礙了生產力落地。對於產業而言,這意味著純粹最佳化模型引數數量和引數量已非王道,未來獎賞的重點將轉移至 RAG(檢索增強生成)架構最佳化與高階 Embedding 技術(如 Qwen3),這將重塑卓越工程與通用模型的競爭格局。
現有程式碼代理的評測多集中在最終補丁正確性,卻忽略了「獲取相關檔案」這一上游關鍵步驟。研究團隊發布的 Agent Retrieval Bench 透過真實編碼工作流程訊號建置,專門用於評估代理程式準確找回所需檔案的能力。
- 評測標準差異化:與傳統依賴詞意相似度的搜尋不同,此基準定義「相關性」標準為代理程式「下一刻需要用到什麼檔案」,包含 code2test、comment2context、trace2code 與 edit2ripple 四種正向檢索任務。
- 資料集規模與構成:共蒐集 427 個樣本,分佈於 25 個儲存庫,細分為 345 個正向範例、50 個自然無標準答案案例與 32 個反事實錯誤儲存庫控制組,並涵蓋 308 個 base-commit 快照、39.2 萬檔案與 790 萬個 chunks。
- 檢索方式競爭勢態:目前沒有單一方法全面領先,其中 Qwen3-Embedding 系列與 RepoMap 表現最佳,分別在 MRR、Recall@20 及預算限制下的語境產出率上奪冠。
- 效能落差揭示:實測發現日誌中的情境選擇在 27-35% 的樣本上會遺漏關鍵檔案,且僅以反事實控制資料校正的閾值在自然無標準案例中並未顯著改善表現,顯示出嚴重的校準缺口。