破除口頭導播生成延遲與品質難題:LeapTalk 單一步驟框架
為何重要
此研究直擊 AI 視覺生成應用的核心痛點——即時性與一致性無法兼得的設計限制。對於即時互動產品開發者(如遠端會議虛擬化身、AGI Agent 視覺介面)而言,200 FPS 的單步生成不僅能大幅降低算力成本,更是實現「真正即時」虛擬人互動的技術基石。雖然目前仍為學術/研究驗證層級,但其架構暗示了未來更輕量、高效的生成工作流可能。
現有的虛擬人即時口頭導播技術長期受制於延遲與畫面穩定性的兩難:多步驟擴散模型過於緩慢,而即時自迴歸模型則易累積錯誤並導致身份漂移。LeapTalk 提出 Novel 框架有效解決此問題。
- 以 data-to-data transport (資料到資料傳輸) 取代傳統的「從雜訊到資料」範式,根據 Brownian bridge 實現單一前向步驟即可生成長達任意時長的影片。
- 採用 SNR-aligned time transformation 技術,確保預訓練的擴散教師模型能平滑遷移知識至學生模型。
- 在極繁的步數壓縮下,引入 audio-driven classifier-free guidance 保持在 200 FPS 下的細緻唇語同步效果。