ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Coding Agents 內部架構(Harness)效能的實證研究

研究 1 個來源 · 5 天前
為何重要

該研究打破了一體適用的代理架設思維,揭示了成本控制不僅依賴模型能力,更仰賴針對性強的 Context Management 與 Action Space 設計。 - 對開發者與工具建構者而言,未來設計應遵循「模組化」與「預算感知」,針對弱模型提供包裝工具,針對強模型提供簡化指令介面如 bash。 - 這發現輕微挑戰了針對所有 LLM 代理都堆疊複雜工具鏈的慣例,轉而強調「依模型能力調整架構」的重要性。

研究針對 Coding Agents 的核心架構進行實證分析,透過調整規劃、動作空間與情境管理三個元件來評估模型效能。研究發現情境管理在預算緊縮時價值顯著,強模型透過簡化介面可大幅降低成本,而具體的效能差異則依模型能力與任務情境而異。

  • 研究在四個模型上進行了 176 種設定組合的測試,涵蓋五種情境管理策略、四種視窗預算及針對規劃與動作空間的消減試驗,基準依序為 SWE-Bench Verified 和 Terminal-Bench 2.1。
  • 情境管理在視窗預算緊縮時效用增加,其效益主要來自於防止「Context-overflow failures」(情境溢位錯誤)。
  • 「規則型資訊裁剪」在 LLM 總結前執行時效率最佳,反觀增加「可回復裁剪內容」的機制因模型很少使用且無準確度收益而被視為多餘負擔。
  • 具備 bash 能力的強模型僅需 bash 介面即可有同等表現甚至更低成本,證明預先定義工具主要是有助弱模型修正 Bash 操作能力的輔助。
coding agentsSWE-BenchTerminal-Bench 2.1harness designcontext managementplanning

來源 · 1 篇報導

首發 Hacker News Front Page arxiv.org 21:06