弱思考力訓練之痛:透過「永不放棄」法則解決 LLM 強化學習中的馬太效應
為何重要
此發現直指當前 AI 計算成本高漲的核心痛點——訓練策略中的「懶惰分配」。若將此理論落實於生產環境,未來的 LLM 訓練流程不再僅依賴算力堆疊,而是轉向更智慧的資源排程演算法,尤其是針對非同步運算與持續迭代策略的硬體支援將成為亮點。
研究指出,大型語言模型在強化學習訓練中存在嚴重的資源分配不均問題:模型傾向於在簡單任務上取得大幅進步,導致對困難任務的運算效率極低,學術界將此稱為 RL �訓練中的「馬太效應」。為解決此缺陷,研究團隊提出了名為「永不放棄」(NGU)的自適應取樣方法,透過非同步運算機制動態重新分配計算資源,強制計算集中在難題上求解。
- 問題定義:建立在「富者愈富」的馬太效應之上,指出標準 RL 方法因將貴重的運算資源浪費在輕鬆的猜題上,導致難題的解決成本相對遞增。
- 核心解法:引入「永不放棄」(NGU),一種簡單的自適應取樣架構,能持續對特定問題生成樣本直到獲得正確答案,從而自動淘汰簡單任務。
- 績效驗證:在數學基準測試 與程式碼任務 測試中,NGU 展現了優異的「每運算效能」,有效克服了標準 GRPO 序列方法在多層級難易題上的表現不足。