ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

NVIDIA 發布開源推論框架 Dynamo:運用 EPD 酸離架構最佳化多模型效能

基建 1 個來源 · 13 天前
為何重要

此技術重新定義了多模模型推論的資源分配邏輯,證實了「分離運算」與「異質算力堆疊」在提升推理效能上的具體價值。對於後端工程師而言,這是在不更換硬體的前提下,最佳化多模態服務延遲的重要工程手段;對於產業而言,這代表未來推論基礎設施設計將更傾向於根據運算任務屬性(編碼 vs. Decode)分配不同等級的 GPU,以提升混合流量的整體效率和資源利用率。

NVIDIA 推出開源推論框架 Dynamo,引入 Encode-Prefill-Decode (EPD) 酸離架構,將視覺編碼與 LLM 預填/解碼階段分離,以解決影像密集型請求的延遲痛點。此方案在特定 workload 下能顯著提升 TTFT,並透過更聰明的 GPU 資源分配策略有效增加吞吐量。

  • 在影像載量較高且輸出序列較短的任務中,TTFT 最高可加速 5 倍,端到端回應時間可加速 7 倍。
  • 混合文字與多模態流量情境下,消除隊頭阻塞後能讓文字請求 TTFT 平均節省 42.2%,圖片請求節省 30.8%。
  • Dynamo 提供兩種部署選項:其一為 Colocated EPD(將 Encoder 與 LLM worker 同 GPU 共享),其二為 Disaggregated EPD(將 Encoder 放置於較廉價的 GPU 層級,透過 NIXL 與主資料流 GPU 傳輸 embedding)。
  • 實測資料顯示,採用 NVFP4 量化 LLM 並維持 Encoder BF16,Colocated EPD 的 goodput 可達聚合架構的 2.64 倍。
NVIDIADynamoEPDMultimodalInference OptimizationNIXL

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 04:31