DAPD:雙錨定策略蒸餾
為何重要
此技術解決了 LLM 後訓練中長期存在的「privilege illusion」(特權幻覺)挑戰,讓學生模型在推斷時能表現得更接近訓練情境,而不僅僅依賴額外的特權輸入。這對於高效能模型開發者而言,提供了一種更可靠的後訓練最佳化路徑;從產業觀點看,若此技術能與 Qwen3-4B 等基礎模型整合,將進一步縮小開源大模型與閉源模型(如 GPT-5、Claude Opus)在推理品質上的差距。
- On-policy(self)distillation (OPSD) 常被用於提升語言模型能力,但會導致「privilege illusion」(特權幻覺)等問題。
- 研究提出 DAPD 框架,透過 Dual-Path Anchoring (DPA) 和 Dual-Source Anchoring (DSA) 兩種錨定策略消除資訊不對稱。
- 在 Qwen3-4B 的測試中,DAPD 平均較 OPSD 顯著提升 2.00 點,且具備跨規模擴充套件性,4B 規模 +2.69,32B 規模 +2.78。