ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

EVOHARNESSBENCH:代理人的 Harness 環境若持續演進,系統是否跟得上?

研究 1 個來源 · 13 天前
為何重要

這份研究揭示了當前 LLM Agent 構建中的關鍵盲點:系統在追加新工具或更新 Harness 時,極可能導致舊有功能的遺忘。開發者若只專注 Agent 能力的堆疊而忽略環境變異帶來的穩定性挑戰,將導致產品在擴張規模時成效衰退。這標定了 Agent 基礎架構開發的新方向,即從單純的「能力增加」轉向更具挑戰的「環境遷移管理」。

LLM 代理系統通常依賴由工具、技能與專業 Agent 組成的「Harness」來架構運作,實務上這個環境會隨新能力加入而不斷演進。研究團隊推出 EVOHARNESSBENCH,將非穩定性置於外部 Harness 本身而非任務流中,專注評估代理人在 Harness 變動下的保持與適應能力。

  • 該基準包含 17 條確定性生成的 Harness 流串,總計 802 個任務、520 個工具、42 個技能與 62 個 Agent
  • 評估設計兩項核心挑戰:部署評估(測試 Harness 擴張時的記憶保留)與自我進化適應評估(測試既有經驗在新功能加入後的效用)。
  • 研究結果顯示 Harness 單純擴張會導致先前解決任務的績效退化(Harness-induced forgetting),且保留舊有能力與適應新功能往往呈現反向拉扯。
EVOHARNESSBENCHLLM AgentsBenchmarkHarnessContinual LearningAgent Performance

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00