針對快速影像與影片生成的並行解碼量捨
為何重要
針對 video diffusion 模型部署算力成本高、推論速度慢的痛點,PDD 修正了過去 Distillation 方法在動態卡頓與視覺多樣性上的缺陷。這項技術為高階視訊生成的 inference 最佳化提供了一個新的、更穩健的參考架構,有助於縮減企業部署多模態生成模型的實際門檻。
Video diffusion 與 flow matching 模型受制於慢速且迭代的取樣過程,運算成本極高;現有的 accelerate 方法雖依賴 variational score distillation (VSD) 來壓縮步數,但常因最佳化困難與模式崩塌導致動畫不自然且多樣性喪失。在此背景下推出的 Parallel Decoding Distillation (PDD),是一種簡化且可擴充套件的股跡量化方法,旨在提升 diffusion 與 flow matching 的推論速度。
- PDD 相容任意預訓練模型,支援可變的 function evaluations (NFE),藉由單次神經網路評估預測多個去噪步驟來加速生成。
- 該方法在不採用 JVPs 或有限差分近似來反推導數的情況下,直接學習平均速度的表示法。
- 在 LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video 和 Qwen-Image Text-to-Image 等模型上,僅需 4-8 次 NFE 即達到 SOTA 效果。