Echoverse:用於大規模訓練電腦操作代理的深度演進環境
為何重要
過往合成環境製作瓶頸在於數量,如今 Echoverse 展示瞭解決方案在於「行為深度」與「針對性導向」。其提出的共演化機制讓環境品質能與模型能力同步迭代,這對於解決電腦操作代理的「灰箱」與盤裡問題至關重要,也代表未來 Sandbox 與虛擬桌面基礎建設將成為 AI 產業的關鍵漲價題材。
- 9B 模型在 12 個特定環境下訓練,準確率從 36.5% 提升至 67.1%,與前沿模型的差距縮小至 14 個百分點。
- 對比測試顯示,深度環境改善了基準模型在真實網站的表現(80.0 → 85.0),而淺層環境則導致效能下降(80.0 → 75.0)。
- 在該系統中,修復單一環境即可將模型準確率從 16.2% 提升至 38.5%,證明環境品質的影響甚鉅。
- 透過獎勵結合「基礎驗證器」與「密集步驟評判」,RL 訓練讓未見資料集分數從 58.8% 提升至 68.0%。