ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

異質記憶體 Chiplets 促進多請求 LLM 推理加速

晶片 1 個來源 · 11 天前
為何重要

此研究探索了「Compute-in-Interconnect(在被動網路內進行運算)」與 CIM 技術融合的時效性,對標當前 AI 硬體儲存體浩瀚與功耗密集的痛點。對於半導體設計與封裝產業,這代表未來 AI Server 的架構可能從純指令集運算 轉為混合式 Analog/Digital slice 運算,這將牽動封裝互連頻寬與 HBM 效能以外的新型解決方案開發。

新加坡國立大學(NUS)團隊發表名為「CHIPSMORE」的技術論文,透過異質性晶粒整合方案解決多模態大語言模型(LLM)推理的高延遲與被動運算瓶頸。

  • 架構整合心阻式 RAM 模擬運算入記憶體(RRAM-ACIM)與靜態 RAM 數位運算入記憶體(SRAM-DCIM)兩種異質性處理元件。
  • 透過可程式化 Inter-PE 計算網路 連線各處理元件,支援多模態與多請求 LLM 推理,包含 base-mode 與 low-rank adaptation(LoRA)兩種模式。
  • 論文於 2026 年 8 月發表在 arXiv 預印本,標題為「CHIPSMORE: Compute-in-Interconnect and -Memory Chiplets for Multi-Mode Multi-Request LLM Inference Acceleration」。
NUSCHIPSMORERRAMCIMLLMChiplets

來源 · 1 篇報導

首發 Semiconductor Engineering semiengineering.com 05:56