GraphVid:互動式圖控視訊生成模型
為何重要
GraphVid 展示了「圖控結構化介面」相比傳統畫素級運動控制(軌跡繪製)在處理複雜場景下的高可擴充性與精確度優勢。這意味著未來的互動式 AI 多媒體工具可能不再依賴繁瑣的軌跡繪製,而是轉向更直觀的邏輯圖編排,這將極大降低高階視訊生成的門檻,推動教育、遊戲預渲染等領域的應用加速發展。其較低的訓練資源需求也為開發高可控性模型提供了一個更經濟的技術路徑。
視訊生成中的精準多物件控制長期受困於文字提示的模糊性或手動軌跡繪製的複雜度,GraphVid 透過圖狀條件引入了一種創新的結構化解決方案。
- GraphVid 是一個匯入「結構化互動圖」的圖控影像到視訊生成模型,旨在提供更靈活且精確的多主體控制。
- 團隊推出了 GraphVid-Bench 大規模互動導向視訊資料集,作為訓練運動感知模型的基礎。
- 相較於 Motion-I2V 等方法,GraphVid 使用了顯著較少的訓練資料與引數數量。
- 在量化指標上,GraphVid 將 FID 最多降低 39.9%、FVD 降低 37.6%,同時大幅提高 PSNR(由 9.87 提升至 15.98)與 SSIM(由 0.38 提升至 0.61)。