AMD 與 Cerebras 推出混合型 AI 推理平臺:EPYC 處理器搭配 Wafer-Scale Engine
為何重要
這展示了除 Nvidia HBM 最佳化的推理架構外的另一種可能性,證明瞭在 decode 階段利用晶圓級晶片(WSE)的記憶體頻寬優勢是可行的。對開發者而言,這意味著在解決 LLM Token 生成延遲上,除了傳統 GPU,現在有了混合 CPU/GPU 與專用晶片的新解法。
AMD 與 Cerebras 宣佈合作開發結合 EPYC 與 WSE 的 AI 推理平臺,旨在整合處理器的低延遲與 WSE 的高吞吐特性。此架構遵循分離式推論(disaggregated inference)概念,但專用硬體分配的角色與 Nvidia 觀點相反。