ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

針對快速影像與影片生成的並行解碼量捨

研究 1 個來源 · 8 天前
為何重要

針對 video diffusion 模型部署算力成本高、推論速度慢的痛點,PDD 修正了過去 Distillation 方法在動態卡頓與視覺多樣性上的缺陷。這項技術為高階視訊生成的 inference 最佳化提供了一個新的、更穩健的參考架構,有助於縮減企業部署多模態生成模型的實際門檻。

Video diffusion 與 flow matching 模型受制於慢速且迭代的取樣過程,運算成本極高;現有的 accelerate 方法雖依賴 variational score distillation (VSD) 來壓縮步數,但常因最佳化困難與模式崩塌導致動畫不自然且多樣性喪失。在此背景下推出的 Parallel Decoding Distillation (PDD),是一種簡化且可擴充套件的股跡量化方法,旨在提升 diffusion 與 flow matching 的推論速度。

  • PDD 相容任意預訓練模型,支援可變的 function evaluations (NFE),藉由單次神經網路評估預測多個去噪步驟來加速生成。
  • 該方法在不採用 JVPs 或有限差分近似來反推導數的情況下,直接學習平均速度的表示法。
  • 在 LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video 和 Qwen-Image Text-to-Image 等模型上,僅需 4-8 次 NFE 即達到 SOTA 效果。
Parallel Decoding DistillationVideo DiffusionFlow MatchingLTX-2.3Efficient Inference

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00