Flux-OPD:隨著語境演變的在不政策擴散
為何重要
這項工作解決了模型冷啟動和缺乏即時回饋監督的問題,提供了一種將語境動態結合至訓練的潛在解決方案。透過處理模型演散過程中的分佈衝突,Flux-OPD 揭示了在不政策擴散(On-Policy Distillation)中加入演變語境的優勢,有助於開發更適應性強的模型。
在開放領域訓練大型語言模型時,獎勵難以衡量,使得演變的語境成為保留任務偏好的潛在訓練訊號。該研究提出了一個名為 Flux-OPD 的新方法,以穩定依據演變語境訓練時的擴散目標。
- 該研究將反向 KL(Reverse KL)目標分解,揭露學生模型在演散時會傾向於語境條件教師的幾何平均。
- Flux-OPD 將情境條件教師與無條件教師之間的差異視為情境差異訊號並注入基礎模型。
- 該方法使用衝突項作為指標,來控制注入情境修正的強度與穩定性。