AMD 聯手 Cerebras 推動與 Nvidia LPU 相抗衡的異構推論架構
為何重要
這標誌著 AI 推論基礎設施從「單一封閉生態體系」向「元件品牌化與異構解耦」的重大轉變。Cerebras 的 SRAM 架構挑戰了 GPU 與 HBM 的高成本路徑,迫使市場重新評估「計算與記憶體分離」的商業合理性。這對於開發者提供了打破 CUDA 生態壟斷的替代方案,對於投資人則揭示了在 AI 基礎設施領域,專注於特定模組(如極致 SRAM 效率)仍具備巨大競爭力。
- 合作緣起與目標:AMD 與 Cerebras Systems 合作建立異構計算平臺,結合 AMD Instinct GPU 與 Cerebras 的晶圓級 WSE 加速器,旨在解決推論所需的記憶體瓶頸並提供超低延遲的 Agent 工作負載支援。
- 技術架構差異:Cerebras 的 WSE 採用片上 SRAM 而非 HBM4,速度更快;該解決方案在架構上將繁重的提示詞處理交由 Instinct GPU,記憶體密集的 Token 生成則交由 WSE 處理。
- 效能預估:儘管尚未公佈具體資料,該組合預計能將每瓦特功耗所產生的 Tokens 提升高達 5 倍。
- 資源最佳化:相較於服務巨型模型所需的高額資源,該方案被預測只需極少數量的晶片(幾十個)即可達到同等效能,對比 Nvidia 需要 2000 個 Groq 3 LPU。