RetireOPD:針對智慧體強化學習的自我退休式現場策略知識傳授
為何重要
該研究解決了 Agent 訓練中的核心痛點——稀疏獎勵導致的訓練不穩定性,透過「自適應退休」機制動態調整教師與學生的依賴關係。這類訓練管道最佳化技術是開發具備複雜模擬能力的 Agent 的關鍵,能顯著縮短 Model-as-a-Service (MaaS) 中高成本 RL 訓練的時間與資源。
多輪智慧體因單一獎勵機制,常需依賴「現場策略知識傳授」來獲取密集監督,但單一教師並非總是可靠。RetireOPD 引入自適應退休策略,讓學生在縮小與教師差距後自動解除安裝教師,改以純 RL 進行終端訓練。
- 在 Qwen2.5 (1.5B 至 7B) 模型上,ALFWorld 成功率相較 RL 基線提升 14.1% 至 18.8%。
- 在 Qwen2.5 (1.5B 至 7B) 模型上,WebShop 準確率相較 RL 基準提升 11.8% 至 19.0%。
- 在所有測試設定中,受訓智慧體的表現均超越原技能條件化教師。