OmegaUse-OfficeVal:利用經濟繫結評估代理在長期辦公套件任務上的表現
為何重要
此研究填補了市場在評估企業級 Agent 時,對於「成本效益比」與「交付品質」量化的空白。傳統評測常忽略人力投入成本,而此基準透過人類基線對比,精確指出當前前沿 LLM 儘管在速度與價格上顯著優於人類,但在交付品質上仍落後人類水準。這對於開發者最佳化代理的魯棒性至關重要,也為產業界判斷 AI 自動化工具的可行商業落地門檻提供了可信依據。
隨著大型語言模型代理被期望能獨立協助完成辦公任務,現有評測基準對於衡量其執行辦公套件 workflows 的合理成本支援有限。研究團隊釋出 OmegaUse-OfficeVal,這是一個專注於長期辦公任務的評測基準,並在任務層級引入了經濟繫結機制,以量化人工與 AI 的成本差異。
- 任務總數為 100 個,源自實務工作者需求,平均每個任務需耗時 2.32 小時的人工。
- benchmark 給予每個任務兩項經濟訊號:人工工時指標與任務價格代理,允許進行價值加權的評估。
- 引入基於細緻評分細則的程式碼驗證器,提供穩定且客觀的自動化驗證機制。