ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SiliconBench:統一記憶體桌面端 LLM 服務的速度、記憶體與保真度比較

研究 1 個來源 · 1 天前
為何重要

過去的評估多數側重純粹速度,這項研究揭示了在統一記憶體架構上,記憶體管理紀律 對 LLM 執行的關鍵影響——當資源接近物理極限時,即便配置了預算,仍可能導致吞吐量劇降。此研究為本地端 AI Agent 與開發者提供了選擇推理引擎的金科玉律,打破了 NVIDIA 一家獨大的參考基準市場。

  • 研究者介紹 SiliconBench 框架,針對 9 個 Apple Silicon 服務引擎,從速度、記憶體與保真度三個維度評估 LLM (Qwen3、Qwen3.5、Gemma 4) 的聊天與代理伺服器效能。
  • vllm-metalQwen3-0.6B 問題上,透過強大的並行架構,在並行度從 1 提升到 16 時,使吞吐量翻倍。
  • DGX Spark 僅作為補充的伺服器效能參考,用以對照 Apple Silicon 上的實作表現。
SiliconBenchApple SiliconQwen3DGX SparkLLM Renderingvllm-metal

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00