Ollama v0.31.2-rc2:鬆綁非 Metal 整合 GPU 的多模態投影器記憶體使用限制
為何重要
此更新大幅改善了 Ollama 在整合 GPU 架構(如 Mac 的 Apple Silicon 或 Intel iGPU)上執行多模態模型(LMM)的效能,減少了與 CPU 資料移動的瓶頸。對於國產 AI 框架與針對本地端執行的 Agent 產品而言,這鞏固了 Ollama 作為輕量級、高相容性基礎工具的競爭力。
Ollama 發布 v0.31.2-rc2 修補程式,解決了先前為了避開 llama.cpp 的 fit pass 佈局衝突,而完全禁止非 Metal 整合 GPU 解除安裝多模態投影器的問題。
- 此舉讓 GB10 與 Strix Halo 裝置即便擁有足夠記憶體,也能針對多模態投影器使用 GPU 加速。
- 新增邏輯會將估計的投影器記憶體加上 1 GiB headroom 加入
LLAMA_ARG_FIT_TARGET以預留空間。 - 若使用者已明確設定
LLAMA_ARG_FIT_TARGET則保持原值,否則系統會自動計算並預留額外的 padding 空間。