跳到主要內容
2026-09-11 日報
開發生態

社群開發者推出 Apple Silicon 推論引擎 Cherenkov,執行 Qwen3.8-Flash-Next 僅需 21GB 記憶體

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群開發者發布的消息,一款針對 Apple Silicon 開發的新推論引擎「Cherenkov」能顯著降低大型語言模型的記憶體需求。開發者在 32GB 記憶體的 M4 MacBook Air 上實測 Qwen3.8-Flash-Next (Q4/Q4ish) 模型,僅需約 21GB 的記憶體分配,生成速度可達 8-22 tokens/s。 Cherenkov 引擎結合了預測性專家串流(predictive expert streaming)與可選的混合精度執行技術。該引擎不會將完整模型載入記憶體,而是將有限的專家(experts)工作集保留在統一記憶體中。系統會透過單層前瞻(one-layer lookahead)預測接下來需要的專家並啟動 SSD 讀取;若沒有足夠時間載入完整的目標專家,引擎可選擇即時載入(JIT)較小的 Q3/Q2 量化版本作為備案。
讀原始報導

這則事件的發展

  1. 2026-09-09網友實測 Qwen3.8-Flash-Next 推論引擎:262K 滿載 SGLang 首字延遲 35 秒,較 llama.cpp 快 7.3 倍
  2. 2026-08-31社群開發者釋出 Mac 最佳化版 Qwen3.8-Flash-Next,M1 Max 實測 Prefill 達 190 tps
  3. 2026-08-28Qwen 3.8 Flash Next 架構解析:結合 N-gram 與 512 專家 MoE,將 51B 參數卸載至 SSD
本期分類