透過 AMD MI355X 部署 GLM-5.2:兩倍成本效益,挑戰 NVIDIA 軟體壁壘
為何重要
這項成果直指 AI 產業的核心矛盾:『效能 vs 成本』的戰場已延伸至硬體生態之爭。事實證明,透過最佳化框架與量化技術,AMD 不僅在硬體規格上具備直接競爭力,更在軟體堆疊的摩爾定律效應下,大幅縮小了 CUDA 的生態壁壘。對投資人而言,這意味著非 NVIDIA 算力的商業可行性正以前所未有的速度提升,中長期粉絲產業鏈的估值邏輯可能需重寫。
隨著前沿模型發布的加速與 NVIDIA GPU 供應短缺,成本效益成為推理服務的關鍵。Wafer 團隊透過 Vercel AI Gateway 與 OpenRouter 展示,在 AMD Instinct MI355X 上以遠低於 Blackwell 的成本執行 GLM-5.2,儘管軟體刻度尚未完美,但已證明 CUDA 軟體護城河正在虧蝕。
- 聚合吞吐量達 2626 tok/s/node(@ 2.4 rps, 20k in / 1k out @ 60% cache),延遲膝點 ≤5s。
- 單流速率(10k in / 1.5k out)為 213 tok/s,雖效能僅為 B200 的 80%,但單位成本比 NVIDIA 便宜 超過 2 倍。
- 採用 sglang 引擎與 MXFP4 量化技術,透過修復 MTP head 路徑衝突與新增 ROCm guard 啟用推測解碼,實現無自定義內核下的最佳化。