Prefix Replay 多回合政策分散技術
為何重要
技術上解決了 Agent 訓練中高成本環境互動的瓶頸,將難以重用的執行軌跡轉化為可重用資源。這有助於降低具備工具使用或代理能力的模型訓練門檻,使分散訓練策略更易於大規模落地。
研究提出 ReOPD 方案,作為 Multi-Turn On-Policy Distillation (OPD) 的加速替代選擇,透過重用預先收集的教師軌跡作為 Replay Prefix,讓學生在離環境的情況下模仿教師完成多回合互動歷史。
- 採用簡單的步驟衰減取樣排程,解決多回合分散中因相關性與教師可靠性不符而產生的分佈偏移問題。
- 在數學推理與搜尋環境測試中,保留或優化了 OPD 的準確率。
- 每次執行 Rollout 的速度比標準 OPD 至少快 4 倍,且學生訓練期間不需要任何工具呼叫。