DATPO:強化 RLVR 推理覆蓋率的難度適應樹狀策略最佳化
為何重要
這項技術直接針對大型語言模型獨特的「鏈式思考」瓶頸:若模型只會一種解法,一旦路徑中斷便會全盤皆輸。DATPO 透過擴充 pass@k,意味著訓練出的模型具備「多路徑思考」能力,這對於未來開發可靠、複雜的 AI Agent 有決定性影響。
雖然強化學習驗證報酬(RLVR)讓大型推理模型表現出色,但受限於訓練時的探索不足,往往難以擴充推理覆蓋率(pass@k)。為解決此痛點,研究提出 DATPO 並闡明瞭三項關鍵設計原則。
- DATPO 整合難度適應性樹狀搜尋與兄弟多樣性獎勵項,具體促進語義多樣性以擴充推理覆蓋率。
- 分析指出難度適應性 Rollout 除提升效率外,對擴充 pass@k 至關重要;且樹狀結構優於平行取樣以發現正確答案。
- 數學推理基準測試驗證 DATPO 在增加 pass@k 方面表現優於基線,直接帶來更強韌的測試時間縮放效能。