ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

GDPevo:評估 Agent 自我進化的實務商業任務基準

研究 1 個來源 · 8 小時前
為何重要

這項研究解決了當前 Agent 評估中「資料汙染」與「歸因困難」的痛點,將評估場景從一般 NLP 任務拉昇至具備邏輯閉環的商務工作流程(如財務、法務)。開發者可依此工具有效驗證 Agent 自我改進機制的實用性;產業觀點則認為,即便進化帶來顯著效能提升,Agent 與理想值的差距仍大,這提醒相關開發者在研發「記憶型 Agent」時需追求更底層的邏輯能力而非僅依賴資料累積。

面對 Agent 自我進化難以評估的現實挑戰,研究者提出了主打 GDP 相關企業工作流程的 GDPevo 基準測試框架。它運用「規則混合」機制將商務流程拆解並重組,確保測試集的表現優異能正確歸因於訓練經驗,而非資料汙染。該框架涵蓋 CRM、ERP、財務等六大領域,並透過全自動化擴充功能應對潛在汙染問題。

  • V1 版本包含 120 個任務,分為 12 組,每組包含 5 個訓練任務和 5 個測試任務。
  • 全自動化資料管道能在一週內將基準規模擴充至 V2 版本,即 240 個任務及 24 組。
  • 評估顯示,自我進化機制導致外洩測試集的準確率提升了最高 16.44 個百分點。
  • 最先進的進化 Agent 依然落後全知蒙版 Oracle 91.6% 的高指標,顯示當前進化能力仍有遠大發展空間。
GDPevoAgent Self-EvolutionBenchmarkEvaluationBusiness Workflow

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00