CAST: 以遊戲求解器作為回饋來源的 LLM Agents 信用給予方法
為何重要
該方法解決了複雜情境下通用 Agent 訓練的「稀疏獎勵」痛點,以極低成本提供高準確率的逐回合過程訊號,相比傳統依賴大量對話的回饋更為高效。對於建立能處理長鏈任務的實體部署 Agent(如自動購物 WebShop Agent)具有重要參考價值,開啟了利用求解器進行高階決策教學的新路徑。
為瞭解決強化學習在訓練 LLM Agents 進行長程決策時獎勵稀疏且缺乏過程性指導的問題,研究提出利用遊戲求解器的狀態價值變化作為回饋。
- 核心方法:提出 CAST(Credit Assignment from Solver Teachers),將求解器的價值改變轉化為優勢,並注入 RLVR 作為逐回合的訓練訊號。
- 理論優勢:在軟體 optimal 求解器假設下,最大化求解器優勢等同於從求解器端的擬真,但只需標量值,不依賴教師 logits。
- 效能表現:在領域內及 unseen-difficulty 評估下,於 Sokoban、Minesweeper、Rush Hour 三個遊戲中擊敗所有訓練基準,且在 ALFWorld 和 WebShop 上獲得最高的平均 zero-shot performance。