ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Flash-dLLM:記憶體感知 KV 快取與並行解碼,加速擴散大語言模型推理

研究 1 個來源 · 11 小時前
為何重要

這項研究精準切中 dLLM 應用落地的核心痛點,將「最佳化」視角從算力密度下放到記憶體層級的 I/O 效率,具有深遠的工程指標意義。對產業而言,這暗示著未來的模型加速不僅僅會計算密集,更會轉向複雜的記憶體管理與融合 Kernel 設計,迫使後端硬體與軟體整合最佳化的強度進一步加深。

拓展大語言模型為非自迴歸生成的可能,但現有擴散模型受制於無效的 KV 快取與並行解碼機制。Flash-dLLM 提出了一套訓練無需的推論加速框架,透過重點解決 GPU 記憶體 I/O 頭痛問題與更新解碼策略,顯著提升 dLLM 的速度與記憶體效率。

  • 發現 GPU 記憶體 I/O 為 KV 快取 dLLM 推理的主要瓶頸,並提出「I/O-aware fused KV-cache kernel」減少冗餘記憶體移動。
  • 採用「KV-cache-driven draft-and-verify decoding strategy」,由 dLLM 自身同時作為起草者與驗證者,無需附屬模型介入。
  • 在數學推理與程式碼生成基準測試中,相較於上一代最佳基線 Elastic-Cache,於 GSM8K 讓速度提升 5.1 倍,HumanEval 提升 11.0 倍。
Flash-dLLMDiffusion LLMKV CacheInference AccelerationHugging Face

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00