ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

「品味」代理:測量與改進長程任務中的決策品質

研究 1 個來源 · 9 小時前
為何重要

現有 Agent 評估常因過度聚焦於端到端成功率,而掩蓋了關鍵節點的判斷缺陷,本研究揭露前緣模型在長程任務中仍有約 40% 的決策失誤率。這對產業而言揭示了下一代 Agent 發展的重點——不僅是模型規模,更是專注於「品味」訓練的具體決策邏輯,改變了對 Agent 商業化進展的預期。

隨著大型語言模型代理人逐漸接手長程任務,執行過程中的決策反覆(如選擇假設或實作路徑)直接影響最終成敗。本研究引入「品味」概念,定義為在未見終局情況下做出最佳長程決策的能力,並建構 Taste-Bench 基準以嚴格評估這項指標。

  • 發表新基準 Taste-Bench,自動從工程與研究任務的執行軌跡中挖掘「分歧點」作為負面或正面範例的測試題,完全不需人工標註。
  • 在前緣模型(frontier models)評測中,表現最佳者僅答對 59.7% 的問題,顯示長程決策能力明顯不足。
  • 研究發現,依賴後續才出現的關鍵證據來做決策的問題難度更高,且增加推理預算並無法有效提升準確率。
  • 證明「品味」可透過遷移學習訓練,經過知識擷取的學生模型在不見任務上的決策更佳,且能提升在 SWE-bench Pro 測試中的端到端成功率。
Taste-BenchFrontier modelsLong-horizon tasksLlamaDistillationSWE-bench Pro

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00