ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

傳遞接力棒:透過軌跡轉送的離線策略驗證(Relay-OPD)

研究 1 個來源 · 8 天前
為何重要

此技術透過引入「接力」機制解決了小型模型訓練中易產生的推理錯誤積累問題,不僅以 50% 的軌跡長度縮減大幅提升訓練效率,更有效改善了數學推理等嚴謹任務的準確度。這對資源受限的開發者與研究人員而言,是更經濟實惠的知識遷移方案,有助於小型模型的商業化潛力。

  • 導致標準 On-policy distillation (OPD) 失效的關鍵在於「字首失敗」,即學生一開始走錯方向後,後續所有生成皆基於錯誤偏差,產生不可靠的監督訊號並浪費計算資源。
  • Relay-OPD 發現老師與學生在遇到錯誤字首時的行為差異(老師傾向重導,學生傾向延續),條件化的將此轉化為「免標籤接力觸發機制」。
  • 研究在 8 個數學推理基準測試中,採用 Qwen3-4B-Instruct-2507 作為教師、Qwen3-0.6B/1.7B 作為學生,Relay-OPD 在所有基準上均取得優異或次優解。
  • 在 1.7B 學生模型上,Relay-OPD 相較標準 OPD 平均表現提升 5.73%,且訓練軌跡長度減少了超過 50%。
Relay-OPDQwen3Off-Policy DistillationKnowledge DistillationTrajectory Analysis

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00