EnvACE:藉由世界排練內化環境動態的 Agent 強化學習方法
為何重要
這項技術解決了 LLM Agent 訓練中高昂的環境構建與成本問題。若 Agent 能透過內化的世界模型運作,將大幅降低對外部控制模擬器的依賴,讓開發者無需持續維運外部環境即可進行長程規劃與決策,這種架構創新將影響未來 Agent 的部署邊界與商業模式。
傳統大語言模型(LLM)Agent 在進行長時程工具使用訓練時,往往需要依賴昂貴的真實或合成環境,或是難以落地的外部模擬器。EnvACE 是一項新的 Agent 強化學習方法,它提出「世界排練」機制,在訓練期間由策略自我模擬環境回應以取代外部互動。
- 透過自模擬替代外部互動:訓練過程中,策略會交替執行「行動」(產生工具呼叫)與「排練」(扮演環境產生回應),並以任務成功獎勵進行端到端最佳化。
- 超越環境擴放的基準表現:在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 等基準測試中,EnvACE 優於傳統依賴環境擴放(environment-scaling)的基線。
- 實作階段降低額外成本:內化的世界模型允許 Agent 在私有內部進行排練,無需額外外部互動即可在中等排練預算下獲得進一步效能提升。