當 EOS Token 發生分歧:解析 On-Policy 蒸餾過程中的長度膨脹機制
為何重要
對執行模型訓練與微調的工程師而言,這項研究揭示了微調過程中 EOS Token 對齊的細微差異可能帶來的嚴重後果,影響訓練效率與資源消耗。 不再假設讀取和寫入的停止集合一致,開發者必須在 Distillation pipeline 中採取更細緻的 Token 同質化或共享停止行動機制,這是確保訓練資源不被浪費的必要步驟。
本研究解析了 On-Policy Distillation 過程中,學生模型回應過長並耗盡生成預算的現象,主要歸因於 EOS Token (結束序列符號) 的誤判。
- 研究在 Qwen3、Llama 和 Gemma 三個模型家族驗證,發現即使宣告的停止集合相同,基礎學生與後續微調教師模型仍可能在 EOS Token 的放置上產生分歧。
- 研究指出,僅同步解碼的停止集合是不夠的,必須將功能上等效的 EOS Token 視為共享的停止行動,才能顯著緩解分歧造成的長度膨脹。
- 學習分析顯示,停止偏好會隨訓練階段劇烈改變,且即便在最後階段完成了對齊,仍存在持續的長度膨脹效應。
- 論文中已釋出整合所提出 Termination-Handling 修正的實作程式碼。