ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

NVIDIA Exemplar Cloud:如何發揮 AI 基礎設施的極致效能

硬體 1 個來源 · 7 天前
為何重要

隨著 GPU 硬體供給充足,AI 運算的競爭力已從採購晶片轉向運維層的效能挖掘。本案例揭示基於 ARM 的 Grace 架構在虛擬化環境下的效能瓶頸,指出 MoE 等大規模複雜模型對 SMMU 虛擬化配置極為敏感。對於開發者與雲服務供應商而言,這意味著簡單的安裝好 GPU 不夠,必須系統性地校準作業系統堆疊(包括 NCCL 佇列與 CPU 電源策略),以避免硬體算力空轉。

NVIDIA 發現,即便建構基於相同的 NVIDIA H100、GB200 NVL72 或 GB300 NVL72 系統,由於 Kernel、Hypervisor、BIOS 與 NCCL 配置的細節差異,導致訓練吞吐量出現 8% 到 12% 的顯著差距,經常使佈署無法達到 Exemplar Cloud 驗證所需的 95% 門檻。

實務案例指出,針對 GB200 NVL72 採用 VM 部署並在 Guest 中執行 DeepSeek-V3 MoE FP8 預訓練時,若未能啟用 hypervisor 的 Command Queue Virtualization(VCMDQ/TCMDQ)功能,CPU 將耗費 24% 的週期在 SMMU 序列化上,導致比原生硬體慢 12% 到 14%。

解決方案在於作業系統層最佳化:必須在 Host Kernel 啟用 tegra241-cmdqv 驅動並透過 hypervisors(如 QEMU/libvirt)將該能力暴露給 Guest。

NVIDIAExemplar CloudGB200 NVL72DeepSeek-V3SMMUNCCL

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 00:00