Sol-Attn:透過即時注意力稀疏化加速視訊生成推論
為何重要
Sol-Attn 顯著改善了長序列視訊生成模型推論的效率權衡取捨,解決了傳統稀疏注意力在計算花費與精準度之間的難題。對開發者而言,這是一種不需重訓練即可套用於現有模型的實用加速方案;對雲端運算供應商與媒體應用商來說,這類推論最佳化技術將有助於壓縮硬體營運成本與提升使用者體驗。
Diffusion Transformers 是高保真視訊生成的核心,但長 token 序列讓注意力機製成為推論瓶頸。本文提出免訓練的 Sol-Attn 演算法,透過單一 online-softmax 通路統合動態路由、稀疏計算與近似修正機制。
- 核心技術:在運算過程中動態調整區塊閾值並重用未能選中區塊的代理評分,實現既受控又無需預先儲存對應圖的動態預算。
- 推論效能:在視訊生成與視訊編輯任務上分別達成 2.1 倍與 2.3 倍的端對端速度提升。
- 優勢:避免了傳統方法中過度稀疏化導致的資訊遺失,在保持視覺品質的前提下優化了準確率與效率的取捨。