CoRT:基於評分準則的政策最佳化 Token 層級計算方法
為何重要
CoRT 解決了 RLAIF(基準 RL)訓練中難以精確還原特定 Token 歸因的痛點,讓模型能更精確地獎勵構成好輸出的關鍵語意片段或格式決策。對於追求高解析度與複雜邏輯輸出的應用(如數學推理、程式碼生成),此技術能顯著提升強化學習的訓練穩定度與最終效能,且在避免同時訓練額外輔助模型的情況下,仍具備競爭力。
傳統利用 GRPO(Group Relative Policy Optimization)的訓練流程,通常將評分準則歸納為單一輸出分數並平均分配給所有 Token,導致無法在單一回應內精確分配相關歸因。研究提出 CoRT,透過「反事實重播」(Counterfactual Replay)技術重新評分,計算 Token 在有無評分準則情境下的對數似然差異來調整權重。在對多種指令調整模型與不同獎勵細粒度的測試中,CoRT 在絕大多數比較上都優於傳統的回應層級 GRPO,平均效益提升了 4.4 個百分點。