ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

透過全棧 NIM 最佳化提升 Nemotron 3 Ultra 的使用者容量

工具 1 個來源 · 12 天前
為何重要

NVIDIA 透過 NIM 2.0.12 強化了其軟體生態主導地位,將過去高度非標準化的推理微調工作轉化為可交付的容器化服務。這對於企業客戶部署 Agentic AI 至關重要,因為它能確保在複雜的 GPU 環境下獲得穩定且可預測的表現,同時減少維護負擔。對於生態系統而言,這標誌著從「模型即服務」向「最佳化效益即服務」的轉變。

隨著 AI 代理工作負載對部署穩定性和資源效率要求提高,NVIDIA 將 Nemotron 3 Ultra 的模型與 GPU 最佳化選項封裝成一套完整的生產級服務,目標是最大化並發吞吐量並嚴格控制延遲。

  • 在 4x B200 系統上,NIM 2.0.12 最佳化服務堆疊在保持 50 TPS/user 達成率的同時,實現最多 2.5 倍的系統吞吐量。
  • 此配置綜合了自適應核心、張量並行、字首與狀態重用以及 MTP(Multi-Token Prediction)推測解碼,達到每秒 1,997 tokens 的速度指標。
  • 開發者可使用 NVIDIA AIPerf 進行自我基準測試,針對處於 ITL 20ms 間隔的特定工作負載,選擇配置如 vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0
NVIDIANemotron 3 UltraB200NIMLLM ServingThroughput

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 00:55