針對 LLM RL 的預測分歧遮罩
為何重要
此技術直指當前 LLM 強化學習訓練中「判斷方向不準」的痛點,透過更精確的遮罩機制減少有害更新,能提升訓練穩定性與效率。對於致力於模型對齊與推理最佳化的開發者,這項演算法最佳化有助於在不增加算力的前提下,縮短模型訓練週期並提高最終效能。
大型語言模型的強化學習訓練通常依賴信任區域遮罩以穩定非策略更新,主流 PPO 演算法以取樣 token 重要性比率檢測距離與方向的變化。然而現有方法(如 DPPO)雖改善了距離測量,但方向判定仍依賴容易與實際分歧變化不一致的單樣本比率。新提出的預測分歧遮罩採用與距離檢測相同的機率分歧度量來預判梯度步的影響,並針對 LLM 的離散 Softmax 策略與 top-K 詞庫暴露機制,開發了兩種輕量級的估計器。