OSReward:建構跨平臺電腦操作代理人的標準化評估與低成本獎勵模型
為何重要
訓練高能效電腦操作代理人需要穩定且低成本的執行驗證機制,過往依賴昂貴商業模型已成瓶頸。OSReward 的公開標準與開源模型能降低開發門檻,加速優質 Agent 模型的迭代最佳化。
電腦操作代理人(CUA)雖然進展迅速,但如何客觀驗證其是否能有效執行指令仍是關鍵難題。研究團隊發布 OSReward 基準,針對視覺語言模型(VLM)作為代理人軌跡裁判者的可靠性進行評測。
- OSReward 為基於多種代理人架構執行人類驗證指令的軌跡建立基準,並經多階段人類註釋標記真實結果。
- 它衍伸出 OSReward-Hard(專注困難案例)與 OSReward-Multi(評分效率與對齊度)。
- 研究發現現有頂尖模型存在「系統性寬大偏誤」,即容易誤將失敗執行標記為成功。
- 團隊推出 OS-Shepherd 模型(9B 與 35B 引數)與 OS-Shepherd-100K 資料庫,能在較商業裁判 30%–60% 的成本下提供可靠訊號。