Mask Forcing:透過雙重噪聲遮罩擴散提升 AR 視訊擴散模型的擬合品質
為何重要
此研究解決了 AR 視訊生成中長期存在的「模式崩塌」與品質受損問題,並提供了一種無需依賴昂貴真實影片資料庫或額外微調階段即可最佳化生成品的解決方案。對於開發者而言,這代表在不增加算力與資料成本的前提下,可透過訓練策略微調來提升模型效能。
- 現有方法透過 Distribution Matching Distillation(DMD)將雙向模型轉為因果自回歸(AR)模型時,常因 Reverse KL Objective 導致 generated videos 遭受過平滑與過飽和困擾。
- 新提出的「Mask Forcing」是一種 Dual-Noise Masking Rollout 策略,旨在自擴散過程中注入經隨機遮罩處理的乾淨訊號,以減輕 Reverse KL 導致學生分佈的少樣化模式崩塌。
- 實驗顯示,該方法在不採用真實視訊資料或額外後訓練階段的前提下,有效提升了多種 AR 視訊擴散擬合方法的視覺品質。