RewardVerse:基準引導式影片獎勵建模與策略最佳化
為何重要
這項研究直球解決影片生成 RL 訓練中長期存在的「標量漂移」痛點,透過結構化的評分依據顯著提升了訓練訊號的穩定性和可解釋性。對於深度學習開發者而言,這降低了影片生成的訓練門檻;對產業來說,它是通往「免驗證高度自動化影片生成」的重要技術基石。
影片生成模型的強化學習 (RL) 仰賴穩健的獎勵模型,但現有模型常因將複雜的主觀品質直接對映為單一數值,導致缺乏明確依據的評分尺度發生「標量漂移」。研究團隊提出 RewardVerse 架構,透過動態評分基準作為中介表示層來抑制此現象。
- 現有影片獎勵模型將主觀品質對映為單一分數,導致 RL 訓練的分數尺度崩塌或漂移。
- RewardVerse 引入動態評分基準作為評估查詢與評分者間的中介層,先提出依據再依據進行基準引導評分。
- 提出的 Rubric-Guided Policy Optimization (RGPO) 是雙階段訓練演算法,包含自我演化種子基準預熱與聯合最佳化。
- 在 16 維度的 EvalVerse benchmark 上驗證,該方法在不僅緩解標量漂移,更在點對點與成對評估上獲得最暫時領先 (SOTA) 成績。