ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

調整師生差異以進行 On-Policy Distillation(Cal-OPD)

研究 1 個來源 · 2 天前
為何重要

現有的模型擴散方法往往會複製教師模型的錯誤或偏差,導致學生模型無法達到應有的上限。這項研究指出透過校準訊號而非全量擴散,可以顯著改善師生模型傳遞 knowledge decay 的問題,對於追求高品質推理模型的開發者而言,是最佳化訓練策略的一個重要參考。

On-Policy Distillation(OPD)透過學習強大教師與即時學生之間的 Token 層級差異,來提升推理模型的能力。然而,原始的差距不僅反映師生間的能力落差,也混雜了教師模型自身的偏差,若進一步使用權益資訊會加重此問題。

  • 提出的解決方案是 Calibrated On-Policy Distillation(Cal-OPD)。
  • Cal-OPD 利用正向與負向權益幹預來估計教師的偏差區域,並保留該區域之外的差距作為最佳化訊號。
  • 在數學推理基準測試中,Cal-OPD 僅保留約 52%–65% 的原始教師-學生意差作為訓練依據,卻一致性地優於標準 OPD 及其變體。
DistillationTeacher-StudentReasoningCal-OPD

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00