Nvidia 收購 Groq 後首波 LPU 測試:3,400 tok/s 溢位的代價與競爭
為何重要
這標誌著 NVIDIA 從硬體製造商向「推理加速平臺」策略的重大轉型,證明瞭 GPU 與 LPU 異構架構在滿足高併發 Agent 需求上的商業可行性。目前在同一任務(Gemma 4 31B)上出現「晶片數量」的巨大差異,意味著 NVIDIA 的策略取徑仍需依賴相對昂貴或龐大的 SRAM 資源堆疊,這可能成為面對 Cerebras 匯入 WSE-3T 新晶片戰術時的成本與架構挑戰。
Nvidia 在收購 Groq 後首度公佈 Groq 3 LPU 的基準測試,顯示其在 Google Gemma 4 31B 模型上可達每秒 3,400 tokens 的速度,並宣稱其效能較 Cerebras 快 4 倍。
- 在 10 萬 token 的輸入序列下,LPX 系統跑出 3,400 tok/s,而競品 Cerebras 測得的資料約為 882 tok/s。
- Nvidia 需要至少 64 個 LPU 運算元在 FP8 精度下處理 Gemma 4 31B 的 31B 引數,而 Cerebras 可透過 1 到 2 個 CS-3 加速器完成,後者使用混合精度。
- DeepSeek V3 等巨大的混合專家模型若要在 LPX 系統上運作,估計需要 1,342 個加速器(約 5 個 LPX 機櫃)。