資訊對等,影像更優:RecCAR 強化多模態影片生成的雙向對應
為何重要
這項研究直指多模態影片生成模型中常被忽略的架構缺陷——雙向注意力的不對稱,透過新增的 KL 正則化器直接最佳化指標,對追求高評價影片合成品質的開發者與產品團隊具有實務參考價值。隨著影片生成對真實感與同步性要求提高,這類針對「Companion modalities」(輔助模態)的約束最佳化,是突破當前生成瓶頸的關鍵技術路徑。
多模態 Diffusion Transformers 在進行影片與其他模態協同生成時,常面臨對應不對等的問題,即模態到影片的約束力往往弱於影片到模態的對應。研究團隊提出 RecCAR,固定強勢的影片到模態對應作為參考,強制建立新的正則化機制以強化反向對應。- 研究定義了橫跨視訊與其他模態的雙向對應若存在差異,即為「reciprocal correspondence gap」。- RecCAR 利用已建立的視訊到模態對應作為固定參考,透過 KL 正則化將較弱的模態到視訊對應向其對齊。- Human Anatomy score 成績從 0.69 提升至 0.75。- 音訊-影片不同步指標從 0.804 降至 0.752。