OmniVAE:具備跨模態對齊功能的音訊與視訊 VAE
為何重要
在多模態模型的技術發展中,OmniVAE 提供瞭解決跨模態時序同步難題的關鍵路徑,指出「預處理空間對齊」比單純最佳化生成器更有效。這對開發者而言是一份具體的技術實作指南,有助於構建更穩定的音視聯合生成系統;對產業而言,這類基礎架構的突破是未來實現高保真虛擬人像、數位內容自動化生產等應用落地的關鍵基石。
現行生成模型正從單獨的視訊或音訊合成,邁向同步的音訊與視訊聯合生成。由於音訊與視訊結構存在根本差異,現有多數方法使用分開訓練的 VAE,導致潛在空間缺乏對齊,逼迫下游生成模型必須從頭學習同步關係。
- 提出 OmniVAE,一個聯合訓練的音訊-視訊 VAE,旨在學習潛在表示間的細緻語義對齊。
- 採用段落級的音訊-視訊對比目標來捕捉潛在空間中的時序-語義對應,並特別著重於從預先訓練的模態特定語義編碼器進行特徵蒸餾。
- 實驗證明這兩個目標一致性地改善潛在空間的可學習性,顯著提升了下游文字到音訊-視訊生成任務的輸出品質與同步精準度。