AV-GRPO:針對多模態聲視訊解耦生成的強化學習框架
為何重要
AV-GRPO 透過「軌跡鎖定凍結塔最佳化」提出了一種降低訓練成本並提升音訊視訊同步一致性的新路徑,對於大型多模態模型的訓練調優具有重要參考價值。該架構將難以計算的耦合獎勵轉化為可管理的單一模態問題,大幅簡化了強化學習在多模態應用中的落地難度。未來此類解耦訓練策略若能成功整合進商業生態,將推動生成式內容創作工具的同步精密度邁向新臺階。
- 現行模型在聲視訊生成上常受制於模態間的同步與對齊不佳,研究團隊提出「AV-GRPO」架構與配套的「5DAV」資料集以改善這些限制。
- AV-GRPO 包含三個關鍵模組:模態錨定式 rollout、軌跡鎖定凍結塔最佳化,以及針對不同模態動態量身訂做的適應性目標。
- 實驗結果顯示,AV-GRPO 在 JavisBench 與 VABench 的評比中,在生成品質、語義對齊與跨模態同步上均優於 LTX-2.3 型號(含 LoRA 與全微調情境)。