ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

RSIAgent:三 Agent 協同進行環境探索與遞迴式自我改進

研究 1 個來源 · 8 天前
為何重要

此技術對開發者而言開啟了「無引數適配」的新典範,大幅降低開發複雜 Agent 的門檻。對產業格局而言,論文指出開源模型即便不經引數微調,透過外部記憶與架構最佳化也能超越部分閉源前沿模型,這可能改變企業對於訓練成本的依賴策略。

面對預訓練模型無法涵蓋的新環境介面、工具與失敗模式,研究提出 RSIAgent 這個無需額外訓練的遞迴自我改進框架。

  • 架構核心:協調 curriculum、actor 與 verifier agents,透過自主記憶構建持續探索並驗證環境資訊,特別是可重用的因果關係。
  • 探索策略:採用 broad-then-deep 方法,結合金速並行探索環境結構,與專注挖掘難解案例、隱藏約束及因果依關的深度探索。
  • 重用機制:產生的記憶可被凍結,直接用於下游任務而不需更新模型引數。
  • 效能成果:在 OSWorld-v2 與 Agent's Last Exam 基準測試中,顯著強化開源模型,讓 Kimi-K3 與 GLM-5.3 打敗 GPT-6 等閉源前沿模型。
RSIAgentMulti-AgentKimi-K3GLM-5.3Open SourceAgent Reasoning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00