調整師生差異以進行 On-Policy Distillation(Cal-OPD)
為何重要
現有的模型擴散方法往往會複製教師模型的錯誤或偏差,導致學生模型無法達到應有的上限。這項研究指出透過校準訊號而非全量擴散,可以顯著改善師生模型傳遞 knowledge decay 的問題,對於追求高品質推理模型的開發者而言,是最佳化訓練策略的一個重要參考。
On-Policy Distillation(OPD)透過學習強大教師與即時學生之間的 Token 層級差異,來提升推理模型的能力。然而,原始的差距不僅反映師生間的能力落差,也混雜了教師模型自身的偏差,若進一步使用權益資訊會加重此問題。
- 提出的解決方案是 Calibrated On-Policy Distillation(Cal-OPD)。
- Cal-OPD 利用正向與負向權益幹預來估計教師的偏差區域,並保留該區域之外的差距作為最佳化訊號。
- 在數學推理基準測試中,Cal-OPD 僅保留約 52%–65% 的原始教師-學生意差作為訓練依據,卻一致性地優於標準 OPD 及其變體。