ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

DAPD:雙錨定策略蒸餾

研究 1 個來源 · 2 天前
為何重要

此技術解決了 LLM 後訓練中長期存在的「privilege illusion」(特權幻覺)挑戰,讓學生模型在推斷時能表現得更接近訓練情境,而不僅僅依賴額外的特權輸入。這對於高效能模型開發者而言,提供了一種更可靠的後訓練最佳化路徑;從產業觀點看,若此技術能與 Qwen3-4B 等基礎模型整合,將進一步縮小開源大模型與閉源模型(如 GPT-5、Claude Opus)在推理品質上的差距。

  • On-policy(self)distillation (OPSD) 常被用於提升語言模型能力,但會導致「privilege illusion」(特權幻覺)等問題。
  • 研究提出 DAPD 框架,透過 Dual-Path Anchoring (DPA) 和 Dual-Source Anchoring (DSA) 兩種錨定策略消除資訊不對稱。
  • 在 Qwen3-4B 的測試中,DAPD 平均較 OPSD 顯著提升 2.00 點,且具備跨規模擴充套件性,4B 規模 +2.69,32B 規模 +2.78。
Qwen3-4BPolicy DistillationDual-Source AnchoringLLM Post-training

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00