PACT:從歸功分配到評判對齊
為何重要
此研究在 RLHF(引用像 GRPO 和 PPO 這樣的演演算法)領域貢獻了嚴謹的數學基礎,解決了爭議已久的「誰應該為何種 Token 獲得獎勵」的定義問題,大幅提升了 RL 後訓練在理論上的統一性與可解釋性。對技術開發者而言,PACT 提供了一個替代標準 RLHF 框架的新路徑,特別是解決了大模型在複雜邏輯推理與程式除錯(如 SWE-bench 驗證資料)上的弱點,意義重大。對投資人而言,這項技術底層的結構性改進長期可能導致新一代的訓練閉環架構出現,影響業界標準。
作為大模型後訓練的核心,強化學習(RL)在 Token 級別歸功分配上缺乏明確數學定義,影響訓練訊號的解釋性。研究透過定義三個正則條件證明可唯一確定此歸功分配,並基於此框架提出新的 Policy Aligned Critic Training (PACT) 演演算法。
- 研究提出了 Completeness(完備性)、Prefix Consistency(字首一致性)與 Neutrality(中立性)三個條件,證明其能唯一決定 Token 級別的歸功分配。
- PACT 採用 Actor-then-Critic 的更新順序,透過重要性取樣(Importance Sampling)修正來讓評判模型更好地與更新後的策略對齊。
- 在代理數學推理任務上,PACT 在四個基準上的平均準確率達到 72.87%,顯著優於 GRPO (高出 8.80 p.p.) 和 PPO (高出 13.16 p.p.)。
- 在 SWE-bench Verified 測試中,PACT 的通過率為 67.4%,分別高於 PPO、GRPO 和 SAO 2.4、2.0 和 3.8 個百分點。