1%的 Tokens 就夠了:在 On-Policy Distillation 中處理梯度估計的研究
為何重要
此研究成果提供了在極低運算成本下維持模型訓練品質的量化依據。對於 LLM 開發者而言,該指標有助於在稀疏監督設定中權衡訓練效率與引數更新穩定性,為最佳化後端訓練策略提供了理論與實務上的數學工具。
本研究探討在 On-Policy Distillation (OPD) 中,僅監督學生產生軌跡小部分 Token 的稀疏監督方法。針對從取樣的 Next Token 估算梯度會導致更新噪聲的問題,研究者在資訊幾何框架提出「資訊效率比 (IER)」。
- 研究提出基於訊號對噪聲分解的 IER 指標,用來評估最優 scalar baseline 下的梯度估計誤差。
- 採用候選集近似法,將 IER 與現有的 usefulness scores 結合進行 Token 選擇,同時保留 reverse-KL 訓練目標。
- 在數學和醫學推理任務上,方法使用低至 0.1% 到 1% 的 Token 預算即可達成與完整 OPD 相當的效能。