在 AMD MI355X 上執行 Kimi K3,受惠於 HBM 容量的成本效益優勢
為何重要
這項測試證實了 AMD 透過大容量 HBM(288GB)在硬體規格上實務贏過 NVIDIA B 系列,進一步縮小了 CUDA 軟體生態的劣勢。隨著越來越多「前臺」 級別的超大型模型需要部署,硬體選項將不再單一依賴 NVIDIA,這對企業 AI 基礎建設的定價策略與供應鏈多元化具備影響力。
隨著 Kimi K3 等海量引數模型的興起,AI 推理對 VRAM 的需求激增,迫使運維團隊重新評估非 NVIDIA 硬體的可行性和成本效益。本簡報報告了 Wafer 團隊如何在 AMD MI355X 上部署高達 2.8T 引數的 K3 模型,儘管面臨軟體生態的挑戰,但透過 Kernel 與架構最佳化,仍能在效能成本比上壓過 NVIDIA B 系列硬體。
- Kimi K3 擁有 2.8T 引數與 1.5TB VRAM 需求,且單一 B200 節點已無法承載,必須使用雙節點 TP16 配置。
- AMD AI355X 在成本上顯著優於 NVIDIA,每 GPU 小時費用約 $2.50,低於 B300 的 $6.00 與 B200 的 $4.25。
- 在 1024-token 輸入/400-token 輸出的基準測試中,MI355X 節點達到 952 tok/s,相較僅 498 tok/s 的 B200 TP16 配置,整體吞吐量提升了 3.8 倍。
- 經過修復 Speculative Decode 與 MLA Prefill Kernel 錯誤,MI355X 的單串流效能提升約 2.2 倍,Prefill 速度從原本的 4–7k 提升至約 13k tok/s。