NVIDIA 發布 AIPerf:解決並發 LLM 基準測試瓶頸的新一代基準工具
為何重要
對於開發者與決策者而言,AIPerf 針對 LLM 推論中常見的 GIL 瓶頸與單點量測缺陷進行重構,代表大型基礎模型廠商開始重視並提供更接近生產級的效能測試框架;這對於依賴相同工具鏈的獨立軟體廠商與雲端服務商來說,是最佳化部署策略的重要路標。
NVIDIA 推出取代 GenAI-Perf 的多程序架構基準測試工具 AIPerf,旨在處理高並發 LLM 測試時的串流瓶頸問題,並透過 GPU 遙測與真實場景模擬提升量測準確度。
- 架構重構:採用多程序設計,由 worker processes 產生負載,獨立的 record-processor services 處理結果,並透過 ZMQ 進行協調,避免單程序因 Python GIL 造成的延遲限制。
- 場景支援:支援超過 15 種 endpoint 型別(含 chat、images)以及 ShareGPT 等公開資料集,並支援來自 Mooncake、Baseten 與 WEKA 的 trace replay 格式。
- 流量模擬:提供常數、Poisson 與 gamma 等 arrival patterns,可調整 burstiness 來模擬生產環境的流量特徵。
- 剖析指標:在 DCGM 或 pynvml 可用情況下,同步報告 TTFT、ITL、請求延遲與 Token 吞吐量,並提供百分位數分佈與 GPU 功耗/利用率等詳細遙測資料。