NVIDIA Exemplar Cloud:如何發揮 AI 基礎設施的極致效能
為何重要
隨著 GPU 硬體供給充足,AI 運算的競爭力已從採購晶片轉向運維層的效能挖掘。本案例揭示基於 ARM 的 Grace 架構在虛擬化環境下的效能瓶頸,指出 MoE 等大規模複雜模型對 SMMU 虛擬化配置極為敏感。對於開發者與雲服務供應商而言,這意味著簡單的安裝好 GPU 不夠,必須系統性地校準作業系統堆疊(包括 NCCL 佇列與 CPU 電源策略),以避免硬體算力空轉。
NVIDIA 發現,即便建構基於相同的 NVIDIA H100、GB200 NVL72 或 GB300 NVL72 系統,由於 Kernel、Hypervisor、BIOS 與 NCCL 配置的細節差異,導致訓練吞吐量出現 8% 到 12% 的顯著差距,經常使佈署無法達到 Exemplar Cloud 驗證所需的 95% 門檻。
實務案例指出,針對 GB200 NVL72 採用 VM 部署並在 Guest 中執行 DeepSeek-V3 MoE FP8 預訓練時,若未能啟用 hypervisor 的 Command Queue Virtualization(VCMDQ/TCMDQ)功能,CPU 將耗費 24% 的週期在 SMMU 序列化上,導致比原生硬體慢 12% 到 14%。
解決方案在於作業系統層最佳化:必須在 Host Kernel 啟用 tegra241-cmdqv 驅動並透過 hypervisors(如 QEMU/libvirt)將該能力暴露給 Guest。