ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

RTX 5090 執行 Alibaba Qwen 3.8 27B 測試:單靠 VRAM 不足以解決軟體與推理引擎瓶頸

硬體 1 個來源 · 15 天前
為何重要

此實測打破了「本地部署只需買顯示卡升級 VRAM」的迷思,驗證了推理框架(如 vLLM、llama.cpp)對硬體效能的決定性優劣。對矽谷硬體廠與開發者而言,未來 AI 基礎建設的護城河將從單純的視訊記憶體規格轉向軟硬體堆疊的整合最佳化,單一 32GB 顯示卡若不配合特定的引擎配置,將無法發揮其商業價值。

阿里巴巴的開放權重模型 Qwen 3.8 27B 近期發布後憑藉其同尺寸模型中的高分表現備受矚目,但詳細測試顯示僅憑充足的 VRAM 空間並非關鍵,推理引擎與系統架構的軟體瓶領才是影響效能的決定性因素。

  • 測試環境採用 Ryzen 7 9800X3D 與 Ubuntu 26.04 LTS,並在 RTX 5090、RTX 4090 以及具備統一記憶體架構的 DGX Spark 上進行對比。
  • 使用 llama.cpp 執行 RTX 5090 在長上下文時效能極差,首個 Token 產生時間可高達約 30 分鐘,不適用於該硬體。
  • 若搭配 vLLM 並使用 Qwen 3.8 27B 的 NVFP4 量化版本,系統需額外 64GB RAM 與至少 64GB swap 才能成功載入;雙路 RTX 5090 結合 MTP 機制,解碼速度可達 100–110 tokens/sec。
  • 在較舊的 RTX 4090/3090 上,必須使用 Q8_0 KV cache 量化並將上下文長度限制在約 112K tokens,否則會爆視訊記憶體。
AlibabaQwenRTX 5090vLLMllama.cpp推理引擎

來源 · 1 篇報導

首發 Tom's Hardware tomshardware.com 21:30