Ollama 發布 v0.34.2-rc2 修復 MLX Runner 記憶體最佳化漏洞
為何重要
Speculative decoding 是縮減 LLM 推理步數以提升輸出速度的重要技術,此修復確保了其在長上下文場景下的可靠性。對於致力於在地化部署大型模型的開發者,這代表使用 Apple Silicon 本地執行超大型模型(如 Qwen)時將更為穩健,大幅降低執行時崩潰風險。
Ollama 針對 MLX Runner 在「speculative decoding」模式下的記憶體洩漏問題發布 v0.34.2-rc2 更新。
- 解碼迴圈原本僅每產生 256 個 token 才釋放一次被釋放的緩衝區,但 speculative decode 經常一次發射多個 token,導致繞過釋放檢查並累積 GB 級別的未使用記憶體。
- 在長上下文語境中,由於 KV cache 擴大卻無法重複利用先前較小的緩衝區,系統記憶體佔用將持續攀升直至耗盡。
- 實測案例顯示,在 98k-token 上下文的 Qwen3.8:27b-mlx 模型於 128 GB 機器上,修復前記憶體曾暴增超過 90 GB 導致崩潰,修復後則穩定維持在 30 GB。