ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

1%的 Tokens 就夠了:在 On-Policy Distillation 中處理梯度估計的研究

研究 1 個來源 · 1 天前
為何重要

此研究成果提供了在極低運算成本下維持模型訓練品質的量化依據。對於 LLM 開發者而言,該指標有助於在稀疏監督設定中權衡訓練效率與引數更新穩定性,為最佳化後端訓練策略提供了理論與實務上的數學工具。

本研究探討在 On-Policy Distillation (OPD) 中,僅監督學生產生軌跡小部分 Token 的稀疏監督方法。針對從取樣的 Next Token 估算梯度會導致更新噪聲的問題,研究者在資訊幾何框架提出「資訊效率比 (IER)」。

  • 研究提出基於訊號對噪聲分解的 IER 指標,用來評估最優 scalar baseline 下的梯度估計誤差。
  • 採用候選集近似法,將 IER 與現有的 usefulness scores 結合進行 Token 選擇,同時保留 reverse-KL 訓練目標。
  • 在數學和醫學推理任務上,方法使用低至 0.1% 到 1% 的 Token 預算即可達成與完整 OPD 相當的效能。
On-Policy DistillationIERGradient EstimationToken SelectionDistillation

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00