AgentOPSD:以遞迴自我調整解決代理強化學習中的關鍵決策歸因問題
為何重要
AgentOPSD 解決了 AGI 應用中「信用分配」的關鍵痛點,讓模型能深入理解哪些中間決策值得精細調整,而非僅關注最終結果。對開發者而言,這提供了一種在不增加訓練成本(無需額外 Rollouts)的前提下,顯著提升代理智慧體在複雜操作任務中穩定性的演化路徑。
在長期多輪的代理任務中,傳統強化學習難以將成功或失敗歸功於決定結果的關鍵步驟,AgentOPSD 提出一種無需評論家 且能精確進行回合級歸因的遞迴方法。該方法將 token 級別的教師-學生對數機率差值聚合為回合級證據,並在對數機率 空間中更新貝葉斯信念狀態,以識別關鍵狀態。在 ALFWorld 等任務中,AgentOPSD 使用 Qwen2.5-7B 時達到了 89.1% 的成功率,且該演算法不需額外的 rollout。