MInTRL:透過稀疏幹預提升線上強化學習效能
為何重要
這項研究提供瞭解決 AI Agent 在強化學習領域「探索效率」問題的新解法:傳統的純線上取樣耗時且難以覆蓋複雜場景,而離線監督則容易導致模型思維邏輯崩壞。MInTRL 提出的「區域性時空幹預」機制,讓模型能像人類審稿人一樣即時修正錯誤但保留神經元狀態,這對於需要精確邏輯的程式程式碼生成與數學推理應用至關重要,有望降低 Agent 訓練的算力與資料成本。
傳統線上強化學習受限於探索不足,而離線策略方法又面臨分佈偏移問題,本研究引進最小幹預強化學習(MInTRL),藉由稀疏且區域性的幹預來擴充套件探索邊界。
- 在生成過程中,判斷幹預策略會定期檢視輸出、替換錯誤字尾並立即返回控制權,訓練時採用序列級優勢迴歸目標,免除重要性取樣的需求。
- 在數學與程式碼基準測試中,一致優於標準的線上與離線策略基線,消融實驗證實中度的幹預強度下效果最佳。