ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

PCSD:代理式強化學習的持久一致性自監督機制

研究 1 個來源 · 1 天前
為何重要

PCSD 透過引入「時間維度」的永續性一致性, 有效解決傳統監督方法在複雜軌跡中易受噪音幹擾或忽略位置變異的問題。這顯示出 Agent 訓練不僅需提升模型能力,更需在前端監督訊號生成層面歸納學習更穩定的策略, 對未來強化學習 Agent 的長短期移動規劃與決策穩定性具有明顯助益。

LLM agents 在面對長多輪軌跡的複雜互動任務時,常因獎勵稀疏導致訓練困難,本篇研究提出 PCSD 來改進 On-policy 自監督 (OPSD) 在教師權重可靠性上的不足。

  • 演算法核心:提出持久一致性自監督 (PCSD),結合遞減整合與趨勢感知調變,從區域性人為偏好訊號的永續性中衍生 token 級別的監督權重,生成連續的監督訊號。
  • 最佳化結合:將 PCSD 目標與 GRPO (Group Relative Policy Optimization) 聯合最佳化,結合稠密的教師導引與稀疏的環境回饋。
  • 實驗資料:在 ALFWorld 綜合分數測試中,PCSD 超越 GRPO 13.3 至 15.6 分、超越 SDAR 5.5 至 6.2 分,並在 GRPO 未見過的資料切片上額外提升 15.8 分。
PCSDReinforcement LearningSelf-DistillationAgentsRLHFALFWorld

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00