跳到主要內容
2026-07-25 日報
模型發布

Ollama v0.32.4 支援 Laguna

GitHub ollama/ollama
Ollama v0.32.4 透過 MLX engine 支援 Apple GPU 的 Laguna,並依指定類型量化 speculative decoding 的 draft-model 輸出層。此版本也修正不同量化 experts 的 Qwen3 MoE 解碼問題,packed gate/up projection 在 M5 Max 上加快約 4–9%。
讀原始報導

背景

MLX 是針對 Apple silicon 統一記憶體架構最佳化的陣列框架;Laguna S 2.1 已有 MLX 移植版本,屬於總參數 118B、每次約啟用 8B 的稀疏 MoE 模型,支援 100 萬 token 上下文。研究顯示,結合量化草稿模型的 speculative decoding 相較 BF16 基準最高可達 2.72 倍加速,但效能增益高度取決於草稿模型的選擇。

這則事件的發展

  1. 2026-07-20Ollama v0.32.2 預發布

來源