ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

多語言數學推理中的策略對齊 Delta 蒸餾

研究 1 個來源 · 1 小時前
為何重要

這項研究證明瞭監督式蒸餾策略(針對特定算術/數學任務)在打破英語語言障礙、提升少語言模型表現上的潛力,為 LLM 訓練提供了一個替代高成本且易受衝擊的 reinforcement learning 的可行路徑。對開發者而言,這是非 RL 之外另一個最佳化特定能力的技術選項;對產業而言,這意味著訓練更通用或對弱勢語言友善的模型,可在減少資源依賴的情況下達成。

On-Policy Distillation (OPD) 正逐漸成為大型語言模型後訓練的主流替代方案,但其於多語言情境下的有效性仍有待深入探討。

  • 研究提出先進的 OPD^2,利用 post-trained teacher 與其 base model 間的機率差距作為學習訊號。
  • 實驗顯示,在 Qwen3 模型上,OPD^2 持續優於原始 OPD,特別在韓語與日語的數學推理上有顯著提升。
  • 使用英語-only OPD 也能提升韓語與日語效能,但往往導致回應偏向英語,證實了維持多語言資料的重要性。
OPDOPD^2Qwen3LLM distillationmultilingual reasoningmathematics

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00