ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

EnvACE:藉由世界排練內化環境動態的 Agent 強化學習方法

研究 1 個來源 · 5 小時前
為何重要

這項技術解決了 LLM Agent 訓練中高昂的環境構建與成本問題。若 Agent 能透過內化的世界模型運作,將大幅降低對外部控制模擬器的依賴,讓開發者無需持續維運外部環境即可進行長程規劃與決策,這種架構創新將影響未來 Agent 的部署邊界與商業模式。

傳統大語言模型(LLM)Agent 在進行長時程工具使用訓練時,往往需要依賴昂貴的真實或合成環境,或是難以落地的外部模擬器。EnvACE 是一項新的 Agent 強化學習方法,它提出「世界排練」機制,在訓練期間由策略自我模擬環境回應以取代外部互動。

  • 透過自模擬替代外部互動:訓練過程中,策略會交替執行「行動」(產生工具呼叫)與「排練」(扮演環境產生回應),並以任務成功獎勵進行端到端最佳化。
  • 超越環境擴放的基準表現:在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 等基準測試中,EnvACE 優於傳統依賴環境擴放(environment-scaling)的基線。
  • 實作階段降低額外成本:內化的世界模型允許 Agent 在私有內部進行排練,無需額外外部互動即可在中等排練預算下獲得進一步效能提升。
EnvACEWorld RehearsalReinforcement LearningLLM AgentWorld Model

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00