研究與評測
開發者發布 Slipstream 推理引擎:在 64GB Mac 執行 95.5 GiB Qwen 模型達 41-52 tok/s,較 llama.cpp 快 1.76 倍
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群開發者發布,專為 Apple Silicon 設計的 C++ Metal 推理引擎 Slipstream 已開源釋出。開發者宣稱,在配備 64GB 統一記憶體的 Mac 上執行 95.5 GiB 的 Qwen3.8-Flash-Next 模型,解碼速度可達 41–52 tok/s,較原本的 llama.cpp 分支(23.1 tok/s)提升 1.76 倍。
在長上下文表現方面,經過 3,086 次真實程式碼請求測試,該引擎在 13 萬 tokens 的上下文中未出現速度崩潰,穩定維持在 33–44 tok/s。在包含數學推理、Python 程式碼與技術寫作等 6 項任務的對比測試中,Slipstream 平均速度為 40.8 tok/s,首字延遲(TTFT)為 1,290 毫秒,皆優於 llama.cpp 的 23.1 tok/s 與 1,863 毫秒。
效能提升主要歸功於非同步層前預取(Asynchronous layer-ahead prefetch)技術,透過非阻塞讀取提示,將即將使用的專家層從 SSD 預先串流至 RAM,避免 GPU 等待 NVMe 延遲,使 prefill 階段延遲降低 28%;此外也結合了混合 MTP 與 Prompt Lookup 投機解碼技術。
Slipstream 伺服器提供相容 OpenAI 的 API 介面。首次載入模型時需耗時 5 至 7 分鐘準備最佳化串流檔,後續啟動僅需 10 至 15 秒;在 64GB Mac 上執行前,需透過系統指令手動提高 GPU wired memory 限制。
讀原始報導