EffectLearner:具世界感知的物件-效果推理用於真實世界視訊物件移除
為何重要
該研究進一步縮短了通用生成式 AI 與專業視覺特效(VFX)工具之間的差距,特別是對於修復「殘影」與長尾物理現象這一難題。從產業角度看,這展示 VLM 與 DiT 架構在單一任務中最終輸出前的深度推理能力,是高階視訊編輯軟體未來發展的技術路徑之一;同時,EffectWorld 資料集的建立標誌著視訊基準測試正朝向更複雜的真實場景邁進。
- 技術架構:提出 EffectLearner,結合基於視覺語言模型的重度推理器 與基於 DiT 的 Video Eraser,利用結構化提示進行跨模態推理以提取效果上下文。
- 挑戰與解方:傳統方法難以處理長尾物理現象與動態互動,該框架透過運動感知遮罩指導與運動一致性監督來提升時空穩定性。
- 資料集與驗證:建立專為複雜物件誘發效果設計的 EffectWorld 資料集,並在標準 ROSE-Bench 上表現優異,於 EffectWorld-Wild 測試中仍保持明顯優勢。