從封閉模型到開源:Multi-Agent Protocol Distillation 橋接代理搜尋的人力資源差距
為何重要
此研究解決了開源模型難以從閉源強模型萃取高階推理能力的瓶頸,憑藉結構化協議成功避開了 tokenizers 不匹配與 hidden logits 的技術障礙。它證實了「結構化中介」優於「文本模仿」,顯著提升了輕量級開源模型(如 Qwen3)在複雜代理任務上的競爭力,為 AI 產品開發提供了更優的開源微調路徑。
代理搜尋讓大型語言模型能透過檢索解決知識密集任務,但傳統依賴結果的強化學習方法輸出稀疏的監督訊號。為此,研究團隊提出 Multi-Agent Protocol Distillation (MAPD) 框架,利用離線多代理系統將查詢拆解並將探索軌跡轉換為結構化 JSON 協議,作為學生模型的訓練中介表示。
- 所提的多代理系統會拆解查詢、檢索證據並產生包含任務型別、推理計畫與抽取事實的 JSON 協議。
- MAPD 在訓練時僅將協議輸入學生政策的特權分支,結合稀疏 RL 目標進行密度更高的指導。
- 測試顯示 MAPD 在七個 QA 基準測試中表現優異,Qwen3-1.7B 成功率達 39.4%,Qwen3-4B 達 44.4%。