針對視訊物件插入與層級分解的明確層級建模
為何重要
明確的前景與背景層級表徵是高階 AI 影像軟體的核心需求,此研究補足了視訊領域缺乏結構化監督的缺口,為後續可編輯的生成式視覺與影片註解應用提供了具體的技術基礎。
針對現有視訊編輯系統缺乏明確層級表示的問題,研究團隊引入 TriLayer 資料集與 DBL-Diffusion 架構,解決了視訊合成後難以重複使用或進一步編輯的痛點。
- 引入 TriLayer 大規模三元組視訊資料集,提供對齊的 composite(合成)、background(背景)與 foreground(前景)影片資料。
- 提出雙分支出擴散架構 DBL-Diffusion,聯合建模 RGB 合成影像與 RGBA 前景層級。
- 實作出 DBL-Insert(層級物件插入)與 DBL-Decompose(視訊層級分解)兩項具體應用任務。