並不該給所有 Token 等同的權重:針對長鏈式推理的反事實敏感度信用重分配方法
為何重要
這項研究對於強化學習(RL)在推理任務上的落地至關重要,它表明單純從 privileged self-teacher 推導出的對齊訊號具有不穩定性,甚至可能導致模型過度依賴易於替換的表面形式而非核心推理邏輯。開發者若採用 CSCR 這類簡單的改編方法,能在現有資源下顯著提升 Long-CoT 的數學推理表現,傳達出微調訊號品質比純粹增加訓練步數更為關鍵的觀點。對產業而言,這意味著未來在訓練具備「接近人類邏輯」的模型時,必須加入對 Token Stability(穩定性)的機制檢核。
強化學習驗證獎勵(RLVR)是提升大型語言模型長鏈式推理(Long-CoT)能力的關鍵,但包含 GRPO 在內的主流方法忽略了 Token 對最終結果的貢獻是不平等的。研究人員透過對照「正確」與「錯誤」兩種截然相反的結果條件來重新評分軌跡,發現過去依賴的特權訊號往往不可靠,且 Token 的敏感度主要反映了其反事實變動的幅度,而非真實的學習價值。基於此發現,研究提出了反事實敏感度信用重分配(CSCR)框架,針對敏感 Token 進行去權重並回歸優勢值。