開發生態
推論工具 slotstream 發布:48GB Mac 可跑 104GB Qwen3.8-Flash-Next,速度達 12 tok/s
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
開發者推出開源推論工具 slotstream,讓 Apple Silicon Mac(需 macOS 14+)能透過 SSD 串流技術,在有限記憶體下運行 125B 參數、4-bit 量化後達 104GB 的 Qwen3.8-Flash-Next MoE 模型。
該工具為單一 Swift 執行檔,無 Python 依賴。系統會根據硬體自動分配記憶體:在 48GB M5 Pro 實測中,引擎啟動僅需約 2 秒(僅載入 3.8GB 主幹),峰值記憶體佔用 33GB,熱解碼速度達 12 tok/s;若在 16GB Mac 上預估佔用 10GB,速度約 4 tok/s;最低可於 8GB Mac 運行(佔用 8.1GB,速度約 3 tok/s,但會觸發分頁警告)。
slotstream 內建伺服器(Port 11434),原生實作 Ollama 與 OpenAI Chat API 子集,可直接搭配 Open WebUI 及現有 SDK 使用,不支援的功能(如工具呼叫、圖像、JSON schema)會明確回傳 400 錯誤。
支援最高 32,768 tokens 上下文,並具備前綴快取(Prefix cache)功能,多輪對話時僅需處理新增內容,例如在 16GB 設備上進行八輪對話,最後一輪的首字延遲可從 25.8 秒降至 6.0 秒。
在記憶體餘裕較大的設備上(分配超過 26GB),支援 MTP(Multi-Token Prediction)草稿頭預測功能,首個草稿準確率達 86%,需額外佔用 1.6GB 記憶體並透過 Python 腳本進行一次性格式轉換。
模型權重共 103.8GB(24 個檔案),內建支援斷點續傳與 SHA256 校驗的下載功能,並會在下載前檢查磁碟空間,官方建議 Mac 至少需具備 512GB 總容量。
讀原始報導背景
混合專家模型(Mixture of experts, MoE)是一種機器學習技術,透過多個專家網路將問題空間劃分為同質區域。它屬於一種集成學習(ensemble learning)形式,過去也被稱為委員會機器(committee machines)。
社群討論
社群讚賞在消費級硬體運行大模型的努力,但對開源生態產生分歧:部分人批評重複開發 MoE SSD offloading 專案而不貢獻給 MLX,另一派則捍衛獨立實驗的價值。技術討論中,有人質疑使用 32GB N-gram table 進行 speculative decoding 的特殊選擇與 SSD 磨損風險。網友也補充了其他硬體實測數據,例如 16GB M3 跑 Qwen3.6-35B-A3B 達 7-8 tok/s,以及 2013 年 Mac Pro (128GB RAM) 也能跑出 10-11 tok/s。
來源
本期分類