SiliconBench:統一記憶體桌面端 LLM 服務的速度、記憶體與保真度比較
為何重要
過去的評估多數側重純粹速度,這項研究揭示了在統一記憶體架構上,記憶體管理紀律 對 LLM 執行的關鍵影響——當資源接近物理極限時,即便配置了預算,仍可能導致吞吐量劇降。此研究為本地端 AI Agent 與開發者提供了選擇推理引擎的金科玉律,打破了 NVIDIA 一家獨大的參考基準市場。
- 研究者介紹 SiliconBench 框架,針對 9 個 Apple Silicon 服務引擎,從速度、記憶體與保真度三個維度評估 LLM (Qwen3、Qwen3.5、Gemma 4) 的聊天與代理伺服器效能。
- vllm-metal 在 Qwen3-0.6B 問題上,透過強大的並行架構,在並行度從 1 提升到 16 時,使吞吐量翻倍。
- DGX Spark 僅作為補充的伺服器效能參考,用以對照 Apple Silicon 上的實作表現。