RSIAgent:三 Agent 協同進行環境探索與遞迴式自我改進
為何重要
此技術對開發者而言開啟了「無引數適配」的新典範,大幅降低開發複雜 Agent 的門檻。對產業格局而言,論文指出開源模型即便不經引數微調,透過外部記憶與架構最佳化也能超越部分閉源前沿模型,這可能改變企業對於訓練成本的依賴策略。
面對預訓練模型無法涵蓋的新環境介面、工具與失敗模式,研究提出 RSIAgent 這個無需額外訓練的遞迴自我改進框架。
- 架構核心:協調 curriculum、actor 與 verifier agents,透過自主記憶構建持續探索並驗證環境資訊,特別是可重用的因果關係。
- 探索策略:採用 broad-then-deep 方法,結合金速並行探索環境結構,與專注挖掘難解案例、隱藏約束及因果依關的深度探索。
- 重用機制:產生的記憶可被凍結,直接用於下游任務而不需更新模型引數。
- 效能成果:在 OSWorld-v2 與 Agent's Last Exam 基準測試中,顯著強化開源模型,讓 Kimi-K3 與 GLM-5.3 打敗 GPT-6 等閉源前沿模型。