多回合長期規劃的物理學:從預訓練、後訓練到多師On-Policy代理蒸餾
為何重要
這是一篇純技術驗證性論文,雖不涉及公司財報或產品釋出,但作為基礎研究,它驗證了世界模型建構與特定後訓練(如OPD)在解決「多步驟任務法成功率」問題上的效應,為開發者提供了實驗性的最佳實踐路徑。從產業壁壘角度看,這類底層理論的突破透過論文傳播,有助於推動代理系統的基準線提升,但並不立即轉化為硬體訂單或實質營收。
研究者建立可控環境,旨在系統性研究基礎模型如何從預訓練到後訓練逐步建立長期規劃能力。
- 預訓練階段顯示,僅靠原子技能不足以達成組合泛化,需結合少數長期資料;同時發現次優軌跡會隨時間推移嚴重拖累最終表現。
- 後訓練階段利用互資訊區分通用規劃模式與特定知識,發現在高品質與長期情境下,OPD 的有效區域比 GRPO 更廣,更新方向更穩定。
- 多師蒸餾(MOPD)透過整合多個教師知識顯示,只有當規劃模式相容時才能實現跨環境泛化,完全衝突的模式會導致學生表現受損。