運用「上政策反向蒸餾」實現弱到強泛化
為何重要
研究直指 AI 後訓練高昂成本的核心痛點,證明瞭弱模型不僅是學習素材,更能透過「反向指導」啟發強模型的潛力。這類技術若能應用於訓練流程中,將大幅縮減全量重訓的資源消耗。對開發者而言,這是一項可視為「低耗材高效能」的訓練範式改變;對投資人來說,它代表在現有成本結構下備受期待的成本最佳化解方。
針對連續模型世代更新與多領域整合的訓練成本問題,研究提出「上政策反向蒸餾」(OPRD),旨在提供一種新型訓練策略,使強模型能藉由弱模型指導來達成超越教師表現的目標。
- 導致機器限制的傳統蒸餾常將弱教師視為目標,OPRD 則透過評估教師 policy 相對於參考策略的 shift,並放大學生在驗證器驅動下的梯度方向。
- 實驗證明 OPRD 在多教師蒸餾場景中,能以比現有 RL 和蒸餾方法更少的學生更新次數達成更高效能。
- 學生模型的回應風格分析顯示,接受 OPRD 訓練的模型更接近僅使用驗證器 RL 訓練的模型,而非原始的弱教師模型。