防止 LLM 強化學習中的強弱越強現象:提出 Never Give Up 策略
為何重要
這項研究揭示了現行強化學習訓練流程的資源配置痛點,導航技術決策者重新審視計算效率。透過「馬太效應」的驗證與 NGU 策略,未來模型調優或許不再片面追求更大的取樣量($k$),而是改進資源分配邏輯,這對於降低調教成本與提升長期學習效能具有重要意義。
這是一篇關於大型語言模型強化學習政策訓練的研究心得,作者名為盧 G(Grenz),指出 RL 訓練中存在「馬太效應」導致難題難以突破。新方法 Never Give Up(NGU)透過動態取樣技巧,改善模型對困難問題的資源分配給予。
- 在 AIME 2025 檢測中,平均分數上升主要來自簡單題的通過,而最難的題目幾乎毫無進步。
- 原始 RL(如 GRPO)使用固定引數 $k$ 取樣,常因浪費計算資源在易解題目上,導致模型在難題上表現停滯。
- 新穎的 NGU 方法以較小的 $k$(如 4)作為基準,若未解出則以 $p=0.9$ 機率重新取樣,將算力集中在難題上。
- 在 GSM8k 測試中,該方法表現優於所有標準 GRPO 的變體。