ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Distill Where You Fail:透過教師引導恢復負 RL 群體的學習訊號

研究 1 個來源 · 13 小時前
為何重要

RSTG 解決了 RL 與 Knowledge Distillation(KDD)整合時的摩擦點,透過精準選擇訊號(如只在失敗處或高分歧處強化學習),平衡了 RL 的探索能力與 OPD 的監督優勢。這對凡是在訓練數學與程式碼生成能力上依賴 RLVR 的團隊而言,是效能提升與成本控制的有效參考路徑。

隨著 RLVR 成為大型語言模型後訓練標準,Group Relative Policy Optimization (GRPO) 雖廣泛採用,卻面臨稀疏獎勵訊號與梯度丟失的問題;雖然 On-policy distillation (OPD) 可提供密集監督,但若與 GRPO 簡單混和會導致效能下降。

  • 本文提出 RSTG 方法,只在關鍵位置進行 Distillation:在樣本層,僅對負零變異量 prompt 進行 OPD 並按教師信心權重;在 token 層,僅針對學生熵值高或教師-學生分歧大的 token 進行訓練。
  • RSTG 額外結合教師模型生成的正確軌跡進行 Supervisor Fine-Tuning (SFT),以注入 RL 難以獲得的正向梯度。
  • 實驗結果顯示,RSTG 顯著優於 naive GRPO+OPD,在數學任務上提升 +4.02%,在程式碼任務上提升 +3.05%。
RSTGGRPOOn-policy distillation (OPD)RLVRReinforcement LearningLLM post-training

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00