DataFlex-RL:RLVR 資料政策評估平臺
為何重要
這項論文挑戰了業界對「精細化資料混合」的依賴,指出在當前技術下,保持資料的均一性反而可能比複雜的領域再平衡更具效益。這意味著工程師與資料科學家應專注於擴充高品質的通用訓練資料來提升模型能力,而非過度調理資料的組成比例,這對開源社群的模型訓練策略調整具有重要指引意義。
研究團隊推出 DataFlex-RL,這是一個用於比較強化學習中具有可驗證獎勵(RLVR)資料政策策略的評估平臺。透過在 Qwen2.5-7B-Base 與 Llama-3.1-8B-Base 上測試 13 種配置,此平臺量化了不同資料選取與加權方式的實際效能。
- 在 Qwen2.5-7B-Base 的測試中,相較於未訓練檢查點,統一 GRPO 策略提升了 7.76 個百分比點的 domain-balanced 平均準確率。
- 實驗囊括了 12 種數學、邏輯與科學基準測試,結果顯示沒有任何一種 rollouts 選擇或再加權方法在統計上優於隨機取樣。
- 評估靈敏度分析顯示,若僅使用五個數學基準與 GPQA-Diamond 建構綜合評分,其排名與涵蓋 12 個領域的評分排序呈負相關(係數 -0.33),這意味著評估方法本身會嚴重扭曲訓練結果的判斷。