ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ScrambleToolBench:讓代理面對未知時回歸窮舉搜尋的互動基準測試

研究 1 個來源 · 2 天前
為何重要

這項研究揭示了當前 LLM 代理在「動態環境下的規劃」上存在關鍵缺陷,即使模型可能聰明到能推斷一般邏輯,卻在面對系統架構失效時表現出低效的盲目搜尋。對於開發 Agent 自動化系統的企業而言,這意味著僅靠堆疊模型能力或增加推理步數無法解決「適應成本」問題,未來的技術路徑可能需要結合外掛式工具或刻意設計的搜尋演算法來彌補。

為瞭解決類似實體環境的工具使用問題,研究團隊推出了隨機打亂工具 schema 的 ScrambleToolBench 互動終端機基準測試。

  • 該基準透過移除工具定義的語義線索與強制連續任務課程,迫使代理只能依靠試誤來發現未知行為。
  • 它引入了對映漂移、隨機動作失敗與時間執行視窗等動態挑戰,以評估代理在環境結構變化下的假設修正能力。
  • 實測顯示,最先進的 language models 在面對結構性變更時,往往無法靈活運用逆推等演算法策略,反而退回到資源消耗巨大的窮舉搜尋。
ScrambleToolBenchAgentBenchmarkOpenAIAdaptability

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00