SVEET:具備易適配性的串流影片編輯框架
為何重要
SVEET 突破了串流影片編輯在延遲與品質間的取捨,將生成式影片推進至即時運算範疇。 對發展者而言,其採用的解耦架構為在現有的擴散模型基礎上開發可控生成提供了標準化的實作範本。 從硬體與商業化角度看,僅使用單顆 H100 即能實現任務需求,降低了對叢集 GPU 的依賴,提升了未來應用部署的門檻與經濟性。
本篇論文介紹 SVEET 框架,該框架僅需在預先訓練的雙向影片擴散模型上進行訓練,就能支援具有高品質的串流影片編輯。
- 框架採用輔助模型分支,以「不受時間影響的自我注意力」機制來編碼輸入源,並將中間特徵注入骨幹網路。
- 提出解耦訓練方案,強制影片可控效能與模型因果性的最佳化方向在特徵空間上正交。
- 在單顆 H100 GPU 上,該模型無需額外加速技術即可達到 15 FPS 的即時執行效能。