JoyAI-Video-Edit:自迴歸擴散實現即時開放式影片編輯
為何重要
此成果將擴散模型的應用場景從離線影像/文本推廣至 Real-time Video-to-Video 生成,證明瞭在 16B 規模下仍能平衡推理延遲與視覺風格的一致性,對於未來開發需要 即時互動的影片 API 或 Agent 服務具有重要意義。作為開放原始碼框架,它可能會激起開源社群在影片生成領域的跟進研究,挑戰現有專屬影音編輯工具的技術壁壘。
JoyAI-Video-Edit 是一個 16B 引數的自迴歸擴散架構,專注於解決即時影片編輯中算力限制與長期時間一致性保持的難題,並能在不需預設影片長度或取得未來幀的情況下運作。
- 結合了 Chunk-wise autoregressive adaptation、Source-Anchored Distribution Matching Distillation (SA-DMD) 以及 Long-Horizon Autoregressive Distillation 等技術,以縮小訓練與推論差距並防止時間漂移。
- 單顆 Nvidia B200 GPU 即可達成約 30 FPS 的 End-to-end 720p 影片編輯速度。
- 實測顯示其優於現有的 streaming editors,且在短影片與長影片上表現均具備與強大 offline 系統競爭的實力。