模型發布
開發者釋出 llama.cpp 分支,透過專家串流讓 64GB Mac 以 27 tok/s 運行 95.5GB Qwen3.8-Flash-Next
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群分享,有開發者釋出自訂的 llama.cpp 分支與混合量化模型權重,成功在 64GB 記憶體的 M5 Pro Mac 上,流暢運行高達 95.5 GiB 的 Qwen3.8-Flash-Next 模型(作為本地程式輔助模型)。
該方案的核心在於「專家串流(expert streaming)」技術,將 MoE 的路由專家保留在 SSD 上,僅在 token 實際路由到時才進行讀取,從而繞過將整個模型載入記憶體的限制。實測數據顯示,開啟 draft head 後生成速度達 27.6 tok/s(關閉時為 18.6 tok/s),在 29k 上下文的實際對話中維持約 20.6 tok/s;4k prompt 的預填充(prefill)速度則約為 367 tok/s。
在最佳化細節上,開發者將 mmap 切換為直接檔案讀取以避免 page fault,使 8k prompt 的處理速度從 274 提升至 451 tok/s。解碼階段則透過 draft head 讓小模型猜測 3 個 token 並由大模型一次驗證,最佳參數為深度 3 搭配 0.3 的信心下限。此外,該分支還整合了基於 gather 的稀疏注意力機制(在 130k 上下文提升 50% 效能)與 Metal MoE 融合技術。
釋出的模型檢查點混合了 Q4_0、Q8_0 輸出層與 UD-IQ4_XS 量化格式。開發者提醒,在 64GB Mac 上,專家快取的實用上限約為 36 GiB,若設定過高會引發系統 swap,導致解碼速度暴跌至 3.7 tok/s。目前該方案僅在 Apple Silicon 內部 SSD 測試,未在 CUDA 或 CPU 環境驗證。
讀原始報導