動態負載平衡式稀疏注意力機制:用於影片生成
為何重要
這項技術直接解決了視覺生成模型在多加速器部署時的『落後者問題』,這是提升高畫質影片生成商業化可行性的關鍵基礎設施環節。對於開發者而言,這提供了一種在維持生成品質不變的前提下,顯著最佳化推理資源利用率的新方法,有助於降低昂貴的 GPU 算力成本。
影片生成的 Diffusion Transformers 在長序列處理上受制於 Attention 運算瓶頸,現有的訓練式稀疏注意力在多 GPU 序列並行時常因路徑分配不均而導致執行落後。FVAttn 透過執行時修補遮罩、P2P 負載遷移與感知式區塊填充,優化了集中式執行效率。
- 使用 Top-p 路由、Top-k 安全底限與視覺感知區塊組織作為稀疏路徑前端。
- 在 step-distilled Wan2.2 I2V 上,將平均負載失衡從 1.34 降低至 1.08。
- 在注意力運算上取得 FlashAttention 的 4.41倍 加速,並為 DiT 推論帶來 2.02--2.11倍的速度提升。
- 在保持競爭級視訊畫質的前提下顯著縮短運算延遲。