ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

OSReward:建構跨平臺電腦操作代理人的標準化評估與低成本獎勵模型

模型 1 個來源 · 2 小時前
為何重要

訓練高能效電腦操作代理人需要穩定且低成本的執行驗證機制,過往依賴昂貴商業模型已成瓶頸。OSReward 的公開標準與開源模型能降低開發門檻,加速優質 Agent 模型的迭代最佳化。

電腦操作代理人(CUA)雖然進展迅速,但如何客觀驗證其是否能有效執行指令仍是關鍵難題。研究團隊發布 OSReward 基準,針對視覺語言模型(VLM)作為代理人軌跡裁判者的可靠性進行評測。

  • OSReward 為基於多種代理人架構執行人類驗證指令的軌跡建立基準,並經多階段人類註釋標記真實結果。
  • 它衍伸出 OSReward-Hard(專注困難案例)與 OSReward-Multi(評分效率與對齊度)。
  • 研究發現現有頂尖模型存在「系統性寬大偏誤」,即容易誤將失敗執行標記為成功。
  • 團隊推出 OS-Shepherd 模型(9B 與 35B 引數)與 OS-Shepherd-100K 資料庫,能在較商業裁判 30%–60% 的成本下提供可靠訊號。
OSRewardOS-ShepherdCUAReward ModelVLMOpen Source

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00