ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

模型還是 Harness?區域性化 Agent 失敗的以互動為中心的分類法

研究 1 個來源 · 2 天前
為何重要

這項研究解決了 Agent 開發中最棘手的「除錯」與「維修分派」問題,提供了標準化的工具來區分模型能力的瓶頸與 Harness 架構的缺陷。 對產業開發者而言,這意味著最佳化路徑將從單純的「堆砌模型規格」轉向精細的「系統工程」,特別是在 Harness(框架)與工具整合上的投入可能比訓練更大模型更能有效提升 Agent 產品化速度。

現有的 Agent 評估常將失敗歸因於系統結果,導致無法區分應最佳化「模型」還是「框架」。本文提出一個以互動為中心的分類法,將 41 種失敗模式精確歸位到具體的元件邊界。

  • 分類法定義了「edges」與「fault side」,明確指出修復應來自模型後訓練、Harness 工程或環境重設計,使分類具備可執行性。
  • 此架構適用於 Coding assistant 到長視窗個人助理等多種 Agent 藍圖,並根據公開 benchmark 與登入的軌跡進行驗證。
  • 在 4 個 frontier models 的評估中,最強的 AI 判讀員與人類標記者的 Cohen's κ 高達 0.76,顯示其類別定義具備穩健的共識與可重現性。
AgentTaxonomyLLM EvaluationMulti-agent

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00