開發生態
社群開發者推出 Apple Silicon 推論引擎 Cherenkov,執行 Qwen3.8-Flash-Next 僅需 21GB 記憶體
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群開發者發布的消息,一款針對 Apple Silicon 開發的新推論引擎「Cherenkov」能顯著降低大型語言模型的記憶體需求。開發者在 32GB 記憶體的 M4 MacBook Air 上實測 Qwen3.8-Flash-Next (Q4/Q4ish) 模型,僅需約 21GB 的記憶體分配,生成速度可達 8-22 tokens/s。
Cherenkov 引擎結合了預測性專家串流(predictive expert streaming)與可選的混合精度執行技術。該引擎不會將完整模型載入記憶體,而是將有限的專家(experts)工作集保留在統一記憶體中。系統會透過單層前瞻(one-layer lookahead)預測接下來需要的專家並啟動 SSD 讀取;若沒有足夠時間載入完整的目標專家,引擎可選擇即時載入(JIT)較小的 Q3/Q2 量化版本作為備案。
讀原始報導這則事件的發展
本期分類