透過 World Models 擴充套件自動化研究代理
為何重要
此研究切中目前自動科研與 Agent 領域最大的痛點——隨著試錯次數增加,真實環境執行的算力成本往往是線性甚至指數級增長。World Model RL 提供了「做模擬」來預演解決方案、降低真實運算門檻的具體方案,讓高效能自動化科研更具商業可行性。同時,在較小引數量(4B/9B)即能打贏超大量模型(48B/120B)的效率驗證,暗示未來的 Agent 架構決勝點將從推擠 GPU 數量轉向最佳化訓練與世界建模效率。
自動化科研(AutoResearch)雖已成為研究目標,但強化學習訓練中出現龐大的計算瓶頸。
- 研究發現,隨著 Trajectories 成長,環境執行因佔用專屬沙盒時間,其成本優勢迅速消失成為瓶頸。
- 作者提出 World Model RL (WMRL) 架構,改用世界模型取代耗時的環境執行以移除瓶頸。
- 為因應世界模型的偏差與噪聲,引入 Online Debiasing 和 Inverse-Variance Denoising 機制以提升收斂保證。
- 實證顯示,WMRL 訓練速度加速 3-4x,且 4B 與 9B 的 post-trained agents 在 benchmarks 勝過 48B 與 120B 的開源模型。