ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SAF-OPD:強化學習優勢融合的穩定框架

研究 1 個來源 · 3 天前
為何重要

該研究解決了 RL 與優勢擴散方法整合的技術難題,提供了一套可實現且穩定的訓練路徑,對於追求深度推理能力的模型至關重要。對開發者而言,這是在不犧牲探索空間的情況下微調 Code/Math 模型的實用工具。從產業角度看,儘管 2.7% 增幅在消費者端感知不明顯,但在高競爭的基準測試中 represents 顯著的技術溢價。

RLVR(可驗證獎勵增強學習)與 on-policy distillation(OPD)本質上互補,但傳統固定係數的優勢融合會因幅度與時間尺度的失配導致訓練熵塌陷。

  • SAF(Stable Advantage Fusion)提出四階段流程,透過「稀疏化-壓縮」處理幅度失配,「暖啟-衰減」處理時間失配,且每階段均可獨立切換。
  • 測試採用 GRPO 實現的 RLVR 框架,在 Qwen3-1.7B/4B/8B 針對七項數學推理與程式碼生成基準評估。
  • SAF 在六種模型設定下均避免了熵塌陷,整體表現遠勝固定係數的 GRPO+OPD,得分提升 0.51% 至 2.70%。
RLVROn-Policy DistillationStable Advantage FusionQwen3Reinforcement Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00