ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

並發存取 Host Memory 與 HBM 以提升語言模型推論吞吐量

研究 1 個來源 · 1 天前
為何重要

這項技術解決了大型語言模型推論中僅依賴 HBM 的頻寬瓶頸問題,透過軟體層面的動態記憶體管理策略,開發者能在不更新硬體的情況下顯著提升推論伺服器的資源利用率。這對於雲端運算供應商而言意味著能以較低的 IT 成本提升大模型的服務效能。從產業角度看,此成果將促使雲端運算架構設計重新評估 Host Memory 在 LLM 推論鏈路中的定位,可能促使運算平臺朝向更靈活的記憶體分層使用方針發展。

Georgia Tech、Nvidia Research 與 Stanford 研究團隊發表名為 BOOST 的執行時間最佳化系統,首次允許語言模型推論無需修改核心程式碼,即可並發存取 Host Memory 與 HBM 以結合兩者的頻寬優勢。

  • 系統引入基於模組運算的頁面放置策略以消除靜態模型權重的存取比變異,並設計了感知波形的自由 KV 頁面池來管理動態資料。
  • 研究團隊將 BOOST 整合至 vLLM framework 並在 Grace Hopper 系統上進行評估。
  • 實測顯示,在高吞吐量情境下 BOOST 可平均提升 31% 的吞吐量,並優於傳統預取策略 15%。在同等批次大小下,BOOST 比 HBM 單一記憶體服務改善 Token 平均輸出時間 4.3%,而預取策略則會使效能惡化 6%。
BOOSTvLLMGrace HopperHBMLLM Inference

來源 · 1 篇報導

首發 Semiconductor Engineering semiengineering.com 07:13