Ollama 發布 v0.32.4-rc0 新增 Laguna 模型在 MLX 平臺的支援與最佳化
為何重要
這項更新對於爭取 Mac 使用者開發者與本地部署 AI 的團隊至關重要,透過在原生 MLX 操作上避開自定義核心,維持了生態系在 Apple Silicon 上的相容性與長期維護性。對於 Laguna 模型的使用者而言,改善了複雜 MoE 架構下的記憶體壓力與執行分數,這也標示著開源社群正陸續解決高複雜度模型在消費級硬體上的落地障礙。
Ollama 更新至 v0.32.4-rc0,專為 Mac Apple Silicon 生態新增 Laguna 系列模型支援,並透過 MLX 框架全面最佳化混合稠密與路由 MoE 架構的執行路徑。
- 支援 Laguna XS 2、XS 2.1 與 S 2.1,並讀取源配置以跨層透應量化策略。
- 採源頭精度保持門控與輸出頭,並於支援項上進行注意力與專家投影的混合量化處理。
- 增加 Gate/Up 融合、排序 GatherMM/GatherQMM 運算及 cache-backed 512-token 預填充分塊以提升效能。
- 修正記憶體分頁問題,將 Laguna 權重保留於 Metal 以提升存取頻率,並棄用過時的 512-token 路徑。