ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ReflectRL:透過反思式到直接式推理學習黃金負向軌跡

研究 1 個來源 · 21 小時前
為何重要

此研究顛覆了對齊訓練中「失敗即無用」的慣例,將負嘗試轉化為功能性訓練訊號。對產業而言,這提供了一條在缺乏完美顯著標記資料集下提升模型能力的低成本路徑。技術決策者若能引入此框架,可望顯著改善模型在複雜情境下的邏輯存活率與自我修正能力。

目前的主流做法常透過「On-policy training」與強模型提供的「golden trajectories」來提升大型語言模型的推理能力,但在強模型面對困難問題失敗時,現有方法會丟失監督訊號,導致訓練斷層。

  • 研究者提出將這些失敗的軌跡定義為「Golden Negative Trajectories」,透過反思而非模仿缺陷軌跡,能產生比直接解題更具優勢的學習效應。
  • ReflectRL 框架分為兩階段:首先誘發「Reflective Reasoning」,再執行「Reflective-to-Direct Policy Transition」將學到的行為回饋給標準的「Direct Reasoning」。
  • 實驗結果在包含 9 個基準測試、4 款 LLM 背景模型及 4 種對齊方法的設定下,證明此方法能帶來一致的推理表現提升且資源負擔極小。
ReflectRLGolden Negative TrajectoriesOn-policy trainingLLMReasoning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00