NVIDIA 採用 TensorRT Multi-Device 簡化 Dynamo-Triton 跨 GPU 模型部署
為何重要
此更新解決了多 GPU 加速與消費級推理服務之間的整合落差,開發者只需保留標準工作流程即可獲得縱向擴充套件帶來的效能提升。對於對延遲敏感的生成式媒體應用而言,這不僅縮短了使用者等待時間,也強化了 NVIDIA 推論生態系統的易用性與競爭優勢。
NVIDIA 推出 Dynamo-Triton 26.07 版本,整合 TensorRT 11.0 的多裝置推論能力,讓開發者能透過單一 gRPC 端點管理多顆 GPU 上的模型執行,而無需自行編寫分散式邏輯。
- 使用 NVIDIA Cosmos 3 Nano 演示,Ulysses 背景並行技術將 44,160 個影片 tokens 散佈至最多 8 個 GPU。
- 端對端生成延遲從 156.595 秒(單 GPU)大幅降至 34.183 秒(8 GPU)。
- Transformer RPC 加速比達 6.09 倍,輸出品質於驗證中通過 MAE 與 PSNR 閾值。