模型發布
Ollama v0.32.4 支援 Laguna
GitHub ollama/ollama
Ollama v0.32.4 透過 MLX engine 支援 Apple GPU 的 Laguna,並依指定類型量化 speculative decoding 的 draft-model 輸出層。此版本也修正不同量化 experts 的 Qwen3 MoE 解碼問題,packed gate/up projection 在 M5 Max 上加快約 4–9%。
讀原始報導背景
MLX 是針對 Apple silicon 統一記憶體架構最佳化的陣列框架;Laguna S 2.1 已有 MLX 移植版本,屬於總參數 118B、每次約啟用 8B 的稀疏 MoE 模型,支援 100 萬 token 上下文。研究顯示,結合量化草稿模型的 speculative decoding 相較 BF16 基準最高可達 2.72 倍加速,但效能增益高度取決於草稿模型的選擇。