自我梯度強制:原生長影片外推技術
為何重要
這項技術填補了目前長時間序列自迴歸影片生成中的關鍵監督缺口,讓模型能從短 contexts 訓練出長時間的連貫性,大幅降低長影片生成的算力與資料成本。對於持續追求視覺生成穩定性的研發團隊而言,這是一個重要的基礎演算法進步。
自迴歸影片擴散模型通常在訓練時使用 Self Forcing 以減少曝光偏差,但受限於歷史記憶狀態的凍結,導致演練出來的特徵無法被未來生成步驟有效利用。Self Gradient Forcing (SGF) 透過兩階段訓練策略,在不反向傳播整個串列演練的情況下,恢復了這段缺失的監督訊號。
- 課題:傳統 Self Forcing 將歷史 KV Cache 視為凍結狀態,造成「歷史語境-梯度缺口」,使其難以透過未來損失學習如何將先前特徵編碼為未來生成更有效的記憶。
- 技術:SGF 採用雙次通過訓練策略,第一階段執行無梯度的自迴歸推論並在取樣的降噪退出步驟記錄輸出,第二階段利用這些記錄進行並行的語境梯度重建,並透過未來影片潛向的損失來監督記憶寫入。
- 效能:在弱初始條件下,SGF 較 Self Forcing 表現更佳,特別是主體識別、背景/佈局一致性及時間穩定性。
- 極限:利用僅 5 秒鐘的訓練視窗外推,SGF 成功生成長達數分鐘長度的影片。