貝爾曼策略最佳化: critic-free 方法提升大型語言模型推理能力
為何重要
這項技術突破簡化了強化學習(RL)與視可驗證獎勵(RLVR)結合的技術門檻。透過移除對評估器的需求並簡化損失函式,開發者能更穩定地在數學推理等複雜任務上微調模型,加速了較 OpenAI o1 等模型更為開放實作 RLVR 的生態發展。
研究團隊提出一種名為貝爾曼策略最佳化(BPO)的方法,旨在透過移除 critic 的機制,解決強化學習在大型語言模型上的實作難度。此方法架構於映象下降策略(PMD)之上,利用貝爾曼方程式重寫目標函式以保留原演算法的最佳解特性。