閉合成環:自回歸生成式渲染中的免訓練回訪一致性
為何重要
這項技術解決了自回歸影片生成在持久化 3D 世界上的核心痛點,讓開發者在進行照片級真實感互動內容(如虛擬遊覽或遊戲)時,能更容易維持畫面的連貫性。它證明瞭結合 3D 引擎幾何資料是改善生成品質的有效路徑,雖然目前仍處於研究階段,但為未來基於 3D 的生成模型提供了新一種的訓練策略參考。
為了將 3D 引擎渲染的深度圖與未貼圖幾何轉化為照片級真實感影片,模型在長時間序的自回歸生成中面臨關鍵挑戰,當攝像機重新回到已逐出記憶體的舊位置時,常因外觀不一致而破壞場景連貫性。
- 研究提出一種無需二次訓練的方法,巧妙利用 3D 引擎已有的時間對應(將姿勢匹配的歷史潛在塊填入 KV cache 作回環記憶)與空間對應(引導注意力至幾何區域),精準解決視覺不一致問題。
- 實驗顯示在 TartanAir 和 TartanGround 資料集的回環軌跡驗證中,該方法在不損失整體影片畫質的情況下,較現有免訓練基準線表現更佳。