深入剖析 vLLM 外科手術刀般的精細系統架構 (2025)
為何重要
詳細拆解 vLLM 的架構是評估它能夠以多大程度挑戰封閉源模型 API 的關鍵。文章揭示了 CUDA graphs 與分頁注意力等技術如何成為現代 LLM 推理的必修基礎,對於開發者自建高效能伺服器及投資人評估開源推理基礎建設的商業化潛力極具參考價值。
本文是系列文章的第一部分,深入探討 vLLM V1 引擎的架構與核心元件,從離線批次推理的基礎逐步擴充套件至應用於雲端的高吞吐量推理系統,分析基於 2025 年 8 月 9 日的 commit 42172ad。
- 系統核心架構包含 vLLM 配置、處理器(將原始輸入轉換為 EngineCoreRequests)、引擎核心客戶端及輸出處理器,旨在支援標準 Transformer 模型。
- KV-Cache 管理器是分頁注意力的核心,維護一個包含數十萬個 KV-Cache 區塊的
free_block_queue作為索引結構。 - 排程器負責決定執行請求(支援解碼 或 預填充),執行流程分為「排程 → 前向傳播 → 後處理」三個階段。