ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

AREX:面向深度研究的遞迴自我改進代理

研究 1 個來源 · 13 天前
為何重要

AREX 覺察到長期視角強化學習容易面臨稀釋獎勵的問題,透過識別關鍵決策點來強化學習效率,這對於構建持續自我最佳化的「研究級」代理至關重要。這顛覆了以往單靠拉昇模型引數量來提升推理能力的趨勢,證明瞭架構設計(如內建審計機制和情境壓縮)才是長期演進的關鍵。對於開發者而言,這提供了一套比目前主流 Agent 更接近複雜人類研究流程的解決方案。

深度研究要求代理滿足多元約束條件,AREX 引入「遞迴自我改進」架構,利用外層審計迴圈和內層研究迴圈交替運作,透過驗證中間結果來反覆精煉答案。

  • 模型規格包括一個 4B 密集型架構與一個 122B-A10B 混合專家架構,並透過「代理式中程訓練」和「長期強化學習」進行訓練。
  • 架構內建自主的情境更新工具,能壓縮互動歷史至簡潔的改進狀態,且不依賴外部模型。
  • 在 BrowseComp, WideSearch, DeepSearchQA 和 HLE 等推理與工具使用基準測試中,AREX 勝過同等規模基準線,並與使用更多激發引數的模型競爭。
AREXRecursive Self-ImprovingDeep ResearchAgentsMoEReinforcement Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00