ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

RetireOPD:針對智慧體強化學習的自我退休式現場策略知識傳授

研究 1 個來源 · 5 天前
為何重要

該研究解決了 Agent 訓練中的核心痛點——稀疏獎勵導致的訓練不穩定性,透過「自適應退休」機制動態調整教師與學生的依賴關係。這類訓練管道最佳化技術是開發具備複雜模擬能力的 Agent 的關鍵,能顯著縮短 Model-as-a-Service (MaaS) 中高成本 RL 訓練的時間與資源。

多輪智慧體因單一獎勵機制,常需依賴「現場策略知識傳授」來獲取密集監督,但單一教師並非總是可靠。RetireOPD 引入自適應退休策略,讓學生在縮小與教師差距後自動解除安裝教師,改以純 RL 進行終端訓練。

  • 在 Qwen2.5 (1.5B 至 7B) 模型上,ALFWorld 成功率相較 RL 基線提升 14.1% 至 18.8%。
  • 在 Qwen2.5 (1.5B 至 7B) 模型上,WebShop 準確率相較 RL 基準提升 11.8% 至 19.0%。
  • 在所有測試設定中,受訓智慧體的表現均超越原技能條件化教師。
RetireOPDReinforcement LearningQwen2.5AgentKnowledge DistillationDeep Reinforcement Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00