ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

根本原因歸因實為搜尋問題:針對長期 Agent 失效的持續搜尋法

研究 1 個來源 · 7 天前
為何重要

這項研究證明瞭 Agent 在長期任務中的「可靠性」瓶頸在於診斷架構,而非單純的模型引數。對產業而言,這意味著「Agent 可觀察性」工具與 middleware 將成為比擁有更大模型更關鍵的利基市場;工程師可以利用這類順手的中介層架構,顯著提升舊有模型的產品穩定性,而無需強迫客戶升級至最高階模型。

隨著 AI agents 參與長期任務,龐大的執行日誌使得自動化根本原因歸因 (RCA) 成為確保系統可靠性的關鍵,但現有 LLM 方法因證據稀疏且分散,難以有效診斷。研究人員指出現有 RCA 依賴單次判斷,容易過早妥協於似是而非的診斷。

  • 研究提出 Continual Search,這是一個迭代框架,反覆 nudges 判斷者搜尋未解決的證據,以修正單次判斷的盲點。
  • 為了評估此方法,研究團隊推出新基準 MegaRCA-Mix,包含 50 個針對長期、執行密集型任務的人類標記錯誤案例。
  • 在此基準上,Continual Search 將 GPT-5.5 的 F1 分數從 0.349 提升至 0.498,增幅超過 40%。
  • 研究發現,「搜尋策略的效能」能超越「模型規模」的優勢,即使較低階模型亦能透過有效搜尋擊敗高階模型。
GPT-5.5Continual SearchMegaRCA-MixRCAAgentLLM

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00