ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

NVIDIA Groq 3 LPX 確定性執行:推動 Vera Rubin 平臺的功率高效高互動推論

硬體 1 個來源 · 7 天前
為何重要

隨著 AI 資料中心電力限制漸成基礎設施擴張的瓶頸,NVIDIA 此舉將焦點從「裸算力」轉向「每瓦算力」,為開發者在建構高成本效率的 LLM 服務(特別是長上下文高互動場景)提供了具體的架構例項。這對於評估全棧 AI 基礎設施投資的邊際成本具有重要參考價值,意指未來成功的 AI 服務將更依賴功率管理的軟硬體協同最佳化。

NVIDIA 試圖透過 Vera Rubin 平臺將「效能每瓦特」定義為 AI 工廠的核心價值,其中 NVL72 配合部署了 Groq 3 LPX 確定性執行模型,旨在解決高互動負載下的電力限制問題。

  • NVIDIA DSX MaxLPS 軟體透過電力轉移策略,在相同功率範圍內可多部署多達 40% 的 GPU 並提升 35% 的 Token 吞吐量。
  • Groq 3 LPX 採用確定性執行模型,對所有 256 個 LPU 晶片進行事元週期精確排程。
  • 透過 Preemptive Power (PEP) 與 Clock Period Synthesis (CPS) 兩項技術,技術邏輯可減少電壓降超過 60% 並縮減電壓保護餘裕,實現低雙位數百分比功耗降低。
  • Groq 3 LPX 與 Vera Rubin NVL72 配合,在長上下文與高互動的 2T+ 引數模型情境下,相比前代 GB200 NVL72,達到每瓦特吞吐量最高提升 35 倍。
NVIDIAVera RubinGroq 3 LPXNVL72Deterministic ExecutionInference

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 00:55