VC-Attention:用於低位元 Attention 的價值平滑與軟體轉換
為何重要
對於視訊生成 AI 開發者而言,VC-Attention 提供了一種不依賴新增訓練成本的低位元最佳化方案,直接提升 BF26 FlashAttention 等基準方法的效能。這從技術硬體側確立了降低資料中心和工作站視訊推理算力需求的方向,進而影響視訊模型競爭力的基準測試結果。
Diffusion Transformers 儘管在視訊生成上表現最佳,但長空間時序序列導致注意力計算成本高昂,限制了低位元部署。VC-Attention 是一個訓練無依賴的低位元框架,透過價值平滑(V-Smooth)與融合機率轉換(ExpCast-FP8)技術,解決了價值離群值與 Softmax 準確性的問題。
- 在 Blackwell 和 Hopper 架構的資料中心 GPU 上,注意力核心速度比 BF16 FlashAttention-4 快 1.46-1.59 倍,工作站卡上更快 2.3-3.6 倍。
- 在 Wan2.2、LongCat-Video 等模型中,端到端 CLIP 生成速度加快 1.13-1.19 倍(資料中心)或 1.36-1.70 倍(工作站)。
- VC-Attention 支援 B200、B300、H200、RTX PRO 6000 和 RTX 5090,利用 V-Smooth 與 ExpCast-FP8 技術直接將 log 域分數對映至 E4M3 程式碼。