ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

監督環境觀察預測如何改變 RL 智慧體終端探索表現

工具 1 個來源 · 5 天前
為何重要

此研究意義在於打破 RL 演訓的慣性思維,提出一種低成本的「針腳」式最佳化方案,即監督改善觀察可反過來增強動作效率。對開發者而言,這種不增加算力或引數量的技術,能直接提升 Agent 在陌生環境下的探索準確率與通用性;對產業來說,這代表著在不依賴更強硬體的前提下,透過演算法微調依然能最大化現有模型基準的邊際效益。

現有的強化學習(RL)訓練慣例(SFT)通常僅對「動作 token」施加損失,而忽略環境觀察作為訓練目標。本研究提出 ActObs 方法,透過在軌跡中同時監督「觀察」與「動作」 token,在不增加引數或額外推論步驟的前提下,強化智慧體對行為後果的建模能力。

  • Qwen3-4B 模型上,相較僅監督動作的基線,ActObs 路線的 GRPO 在終端機 benchmark Terminal-Bench 2.0 上,於所有評估的抽樣預算下都達到更高的 pass@k 效能。
  • 在額外驗證的 aider-polyglot 跨領域編輯任務中,ActObs4B 版本達到 +4.2 pp 的 pass@1 提升,並解決更多訓練資料中未出現過的陌生任務。
  • 分析顯示,「動作與觀察梯度正交」是單一監督訓練的痛點,ActObs 透過聯合監督減少策略變動,保留較高熵值並使 RL 後的模型更接近 SFT 初始狀態。
ActObsQwen3RL AgentObservation SupervisionTerminal-Bench 2.0GRPO

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00