AMD 與 Cerebras 攜手推出結合 Helios 與 Wafer-Scale Engine 的超低延遲 AI 推論平臺
為何重要
此合作標誌著 AI 推理基礎設施正從單一硬體架構轉向「異構組合」,以精準駕馭延遲敏感與高吞吐量工作負載的需求差異,這對於需要即時回應的 Agent 與 Copilot 應用至關重要。對開發者而言,這提供了在不犧牲規模量的前提下最佳化響應時間的具體解決方案路徑;對產業而言,這展現了硬體廠商透過靈活組合供應鏈來搶攻推理市場商機的策略重要性。
AMD 與 Cerebras Systems 於 2026 年 7 月宣佈結盟,發表將 AMD Helios™ 與 Cerebras Wafer-Scale Engine (WSE) 結合的單一曲解推論工作流程,旨在滿足即時應用與高吞吐量並存的需求。
- 該解決方案將一體化運作,AMD Helios 負責提示詞處理與上下文視窗應用的極高吞吐量,Cerebras WSE 則專注於記憶體頻寬導向的超低延遲令牌生成。
- 預計此組合能提供高達 5 倍的 tokens per second per watt (T/s/W) 效能指標。
- 商用化目標定在 2026 年下半年,先透過 Cerebras Cloud 匯入市場,同時 Cerebras 亦計畫在其自家資料中心部署 AMD Helios 系統。