不一樣的提示有不同的價值:探索導向提示鷹架應用於多模態強化後訓練
為何重要
此研究直擊多模態強化學習中確定高價值輸入的痛點,提供不需依賴昂貴導引模型或額外算力即可改善訓練良率的策略;對開發者而言,此方法能顯著降低 RL 後訓練的時間成本與資料需求,是最佳化 MLLM 開發管道的重要進展。
多模態大型語言模型的強化學習 後訓練中,現有方式常將資源平均分配給不同訊息量的提示,導致訓練效率低下。本研究提出探索導向的提示鷹架框架,透過動態調整訓練提示分佈來提升策略改進的效能。
- 核心指標「探索潛能分數」(EPS)利用 KL 常規化策略改進理論,可基於 on-policy rollout 統計數值即時計算提示效用,無需額外開銷。
- 方法保留低效用提示,並利用教師模型生成導引重寫,將教師監督重新定義為訓練資料精煉而非單純模仿輸出。
- 在 Geo3K 和 MMK12 上整合 GRPO,方法在領域內表現最佳提升達 9.7%,在領域外 benchmark MathVision 獲得 11.5% 增益,MMMU-Pro 則提升 11.1%。