從 Pascal 到 Blackwell GPU 的 Warp 分歧效能特徵分析
為何重要
此研究確立了 NVIDIA GPU 在 Warp 分歧上的核心效能成本模型(如 32/k 效率與佔用率無關)具備跨代穩定性,為開發者最佳化程式碼提供了可預測的邏輯基礎。儘管 Blackwell 架構在指令集層面(如指令分類、部分掩碼同步)新增了複雜機制,但根本的頻寬限制成本並未改變,開發者可依循既定模式進行程式設計。
NVIDIA GPU 自 Volta 世代引入 ITS 後普遍認為 Warp 分歧處理方式固定,本篇研究透過橫跨網路與消費級 Blackwell、Ampere、Hopper 代際的週期精度微基準測試與編譯器 SASS 分析,實際驗證並區分了這些架構在硬體行為與控制流指令上的異同。
- 發現分歧路徑的執行時間 T(k) 隨路徑數 k 線性序列化(T(k) ≈ sk),效率隨 32/k 下降,且懲罰成本完全不受佔用率影響。
- 證明即使在那個 Warp 分歧屬於開發者可見成本的 Pascal 時間點,硬體穩定性模型與今日並無二致。
- 延遲重聚(超越立即支配點)的案例從 Ampere 的 29 個銳減至 Blackwell 的 2 個,且 Blackwell 匯入了二級收斂屏障、統一支配分支指令及顯式部分掩碼同步。