AREX:面向深度研究的遞迴自我改進代理
為何重要
AREX 覺察到長期視角強化學習容易面臨稀釋獎勵的問題,透過識別關鍵決策點來強化學習效率,這對於構建持續自我最佳化的「研究級」代理至關重要。這顛覆了以往單靠拉昇模型引數量來提升推理能力的趨勢,證明瞭架構設計(如內建審計機制和情境壓縮)才是長期演進的關鍵。對於開發者而言,這提供了一套比目前主流 Agent 更接近複雜人類研究流程的解決方案。
深度研究要求代理滿足多元約束條件,AREX 引入「遞迴自我改進」架構,利用外層審計迴圈和內層研究迴圈交替運作,透過驗證中間結果來反覆精煉答案。
- 模型規格包括一個 4B 密集型架構與一個 122B-A10B 混合專家架構,並透過「代理式中程訓練」和「長期強化學習」進行訓練。
- 架構內建自主的情境更新工具,能壓縮互動歷史至簡潔的改進狀態,且不依賴外部模型。
- 在 BrowseComp, WideSearch, DeepSearchQA 和 HLE 等推理與工具使用基準測試中,AREX 勝過同等規模基準線,並與使用更多激發引數的模型競爭。