ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

從 RLVR 擴充套件至 RLSVR:利用 SpyRL 將開放式任務轉化為可驗證獎勵環境

研究 1 個來源 · 3 天前
為何重要

這項研究直擊 LLM 強化學習在開放式任務上的評估盲點,提出了一種不依賴人類偏好或評估模型的成本較低之解方。將不可驗證的生成任務轉化為可驗證的遊戲範式,有望成為提升 LLM 原創性、寫作與邏輯推理能力的關鍵技術路徑。

目前 Reinforcement Learning with Verifiable Rewards(RLVR)的應用主要受限於數學或程式碼等可確定性驗證的領域。為了將此成功經驗擴充套件至開放式生成任務,研究團隊提出 Reinforcement Learning with Self-Verifiable Rewards(RLSVR),主張透過任務轉換將開放式任務轉化為具備可驗證獎勵的訊號生成環境。

  • 提出新架構 RLSVR,透過建立 SpyRL 多代理自對弈環境來訓練模型,約束代理在非對稱資訊下完成目標並投票辨識臥底。
  • SpyRL 利用預先知曉身分的臥底關鍵資訊,讓遊戲結果(按贏/輸投票)成為完全可自動驗證的強化訊號。
  • 實驗驗證了方法的有效性,SpyRL 在如文字摘要與創意寫作等非驗證任務上優於現有自我提升手法,在數學推理上也取得穩定收益。
  • 研究成果與程式碼已於 GitHub 釋出。
RLVRRLSVRSpyRLLLM Reinforcement LearningSelf-Play

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00