ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Nvidia 收購 Groq 後首波 LPU 測試:3,400 tok/s 溢位的代價與競爭

硬體 2 個來源 · 29 天前
為何重要

這標誌著 NVIDIA 從硬體製造商向「推理加速平臺」策略的重大轉型,證明瞭 GPU 與 LPU 異構架構在滿足高併發 Agent 需求上的商業可行性。目前在同一任務(Gemma 4 31B)上出現「晶片數量」的巨大差異,意味著 NVIDIA 的策略取徑仍需依賴相對昂貴或龐大的 SRAM 資源堆疊,這可能成為面對 Cerebras 匯入 WSE-3T 新晶片戰術時的成本與架構挑戰。

Nvidia 在收購 Groq 後首度公佈 Groq 3 LPU 的基準測試,顯示其在 Google Gemma 4 31B 模型上可達每秒 3,400 tokens 的速度,並宣稱其效能較 Cerebras 快 4 倍。

  • 在 10 萬 token 的輸入序列下,LPX 系統跑出 3,400 tok/s,而競品 Cerebras 測得的資料約為 882 tok/s。
  • Nvidia 需要至少 64 個 LPU 運算元在 FP8 精度下處理 Gemma 4 31B 的 31B 引數,而 Cerebras 可透過 1 到 2 個 CS-3 加速器完成,後者使用混合精度。
  • DeepSeek V3 等巨大的混合專家模型若要在 LPX 系統上運作,估計需要 1,342 個加速器(約 5 個 LPX 機櫃)。
NvidiaGroqLPUCerebrasGemma 4AI Inference

來源 · 2 篇報導

首發 The Register theregister.com 23:00 報導 Techmeme techmeme.com 00:30