ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

OmegaUse-OfficeVal:利用經濟繫結評估代理在長期辦公套件任務上的表現

研究 1 個來源 · 7 天前
為何重要

此研究填補了市場在評估企業級 Agent 時,對於「成本效益比」與「交付品質」量化的空白。傳統評測常忽略人力投入成本,而此基準透過人類基線對比,精確指出當前前沿 LLM 儘管在速度與價格上顯著優於人類,但在交付品質上仍落後人類水準。這對於開發者最佳化代理的魯棒性至關重要,也為產業界判斷 AI 自動化工具的可行商業落地門檻提供了可信依據。

隨著大型語言模型代理被期望能獨立協助完成辦公任務,現有評測基準對於衡量其執行辦公套件 workflows 的合理成本支援有限。研究團隊釋出 OmegaUse-OfficeVal,這是一個專注於長期辦公任務的評測基準,並在任務層級引入了經濟繫結機制,以量化人工與 AI 的成本差異。

  • 任務總數為 100 個,源自實務工作者需求,平均每個任務需耗時 2.32 小時的人工。
  • benchmark 給予每個任務兩項經濟訊號:人工工時指標與任務價格代理,允許進行價值加權的評估。
  • 引入基於細緻評分細則的程式碼驗證器,提供穩定且客觀的自動化驗證機制。
OmegaUse-OfficeValLLM AgentsBenchmarkOffice-SuiteEconomic Grounding

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00