重構 PPO 評價學習:理解並緩解價值扁平化
為何重要
Value Flattening 揭示了標準 PPO 在 RLHF 流程中可能因過度平滑過程而劣化最終策略,而 SP^3O 提出的稀疏監督機制證明瞭只需關注關鍵狀態即可達成更高維度的最佳化。這對依賴 RLHF 的大模型開發者而言,提供了一種能降低訓練成本與計算資源的具體最佳化路徑,值得在落地訓練時考量。
在大型語言模型的強化學習中,PPO 演算法通常依賴評價者來預估狀態價值,然而研究發現這種標準做法存在一種稱為「Value Flattening」的系統性故障,導致模型難以捕捉狀態間的價值變化。
- 現象:評價者預測值在狀態發生劇烈變化時維持平坦,源於評價者損失中的隱含方差懲罰與時間相關狀態的重複更新。
- 解法:提出 SP^3O (SParse Proximal Policy Optimization),採用稀疏監督策略,僅對回應中極少數分離良好的狀態套用價值損失。
- 驗證:在 Qwen3-Base 模型上測試,每個回應僅監督三個狀態即可顯著減輕價值扁平化,並跨模型規模與評估套件提升策略表現。