透過自我知識提取提升基於標準強化學習
為何重要
「基於標準強化學習」是讓 LLM 在長文本或數學推理等複雜任務上提升的關鍵技術路徑。此研究精準釐清了當前方法在探索不足與訊號遺失上的機制缺陷,提出的自我知識提取方案有效解決了訓練與推導的不匹配,顯著降低算力消耗。對開發者而言,這是下一代 RL 訓練架構的重要參考。
- 基於標準強化學習雖有助於改善模型於開放式任務的表現,但在「未探索標準(UC)」與訓練推導不一致的問題上仍待釐清。
- 研究發現,約 57% 的樣本在訓練過程中受「受抑制標準(SC)」影響,平均每個樣案包含 1.8 個此類標準。
- 提出 CriPO(Criterion-Distilled Policy Optimization),透過 on-policy 自我知識提取與標準注入自我老師及反事實自我老師來同時解決兩大問題。
- 在醫學及科學基準測試中,CriPO 能以約 2倍 更少的最佳化步數達成強於先前方法的收斂效果。