DeepSeek V4 Flash 整合 AMD MI300X:vLLM ROCm 與 AITER 運算最佳化實戰
為何重要
證明在不依賴 NVIDIA 顯示卡的前提下,經過深度客製化的 AMD 軟體生態(支援最新軟體修補與最佳化庫)已具備執行頂級模型的能力,單卡 MI300X 的 HBM3 容量已足以替代部分昂貴的多卡叢集節點。對產業而言,這顯示出通用 GPU 平臺在軟體相容性與執行緒並行的改善速度,若持續追蹤,將有助於評估 AMD 在企業級推理市場的滲透率變化。
該專案提供一套包含 Docker Compose 與補丁,以在生產環境中透過單一 AMD MI300X 執行 DeepSeek-V4-Flash-0731(304B 引數)的完整架構配置。
- 硬體與部署優勢:模型可全部載入於 192 GB HBM3 空間內,利用 96 GiB CPU 層級搭配 GPU KV 快取進行資料移除管理,展現單卡部署潛力。
- 核心技術修正:包含針對 MI300X 特有的 FP8 格式(FNUZ vs OCP)、高併發 MoE 路由、CPU-KV 同步的修補程式,以及確保正確性的 DSpark 掃描演算法。
- 效能表現:配合 2,048-token 排程預算,未快取的前置處理可達 7.9–8.5K tokens/s;引入該配置後,長提示的冷啟動延遲從 8.2 秒縮短至 0.5 秒。