ViRDM:針對少步驟因果視訊生成的分佈匹配調優
為何重要
此研究將視訊後訓練的資源密集度從三網路架構降級為單一生成器最佳化,顯著降低 GPU 記憶體與訓練時間,有助於企業在資源受限下部署低延遲的視訊擴散服務並縮減營運成本。
- Few-step autoregressive (AR) video diffusion 雖具低延遲優勢,但傳統方法依賴昂貴的 Teacher-Critic 蒸餾架構。本研究提出 ViRDM,移除這兩個元件,僅針對生成器使用預計算的分佈目標進行微調。
- 透過整合隨機截斷監督、輕量型 VAE 解碼器與階段式 VJP,ViRDM 克服了記憶體不可追蹤的梯度路徑以及時間動態約束不足的問題。
- 在僅需 20 次生成器更新及 16 A100 GPU-hours 的資源下,ViRDM 在官方 VBench 評估達到 84.87 分,優於先前的最佳 Few-step 因果基準線 0.36 分。