跳到主要內容
2026-08-31 日報
開發生態

社群開發者釋出 Mac 最佳化版 Qwen3.8-Flash-Next,M1 Max 實測 Prefill 達 190 tps

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群 r/LocalLLaMA 開發者分享,其針對 Mac 環境深度最佳化 Qwen3.8-Flash-Next 推論效能,並已於 GitHub 釋出修改版的 llama.cpp 分支。在 M1 Max 64GB 設備實測中,透過開啟 MTP(Multi-Token Prediction)與快取最佳化,Prefill 速度最高可達 185-190 tps。 該專案的核心技術包含:為張量、engrams 與 MTP 導入 SSD 串流;混合 Unsloth 與 AtomicChat 量化權重打造自訂 Q4 版本,以達到最佳效能位元比;以及開發 Metal 最佳化的稀疏注意力機制,將 llama.cpp 原本的二次方效能衰減改善為近乎線性。 在記憶體管理方面,專案採用 Q4_0 MTP,以一半記憶體達成與 Unsloth Q8_0 相同的接受率,並支援動態 MTP 預測大小調整,當上下文長度過大時會自動停用 MTP 以節省 KV 快取空間。 開發者實測指出,開啟 MTP 雖會佔用更多記憶體,使 4K 文本的 Prefill 降至 170 tps,256K 長文本降至 150 tps,但解碼(Decode)效能可大幅提升 70% 達 22 btps。開發者亦透露,該專案歷時三週,開發過程大量依賴 Claude 輔助完成。
讀原始報導

背景

多詞元預測(Multi-Token Prediction,簡稱 MTP)是一種新興技術,能讓語言或多模態模型同時預測多個詞元,藉此提升模型的效率與能力。近期有開發者針對 Mac 裝置與 MTP 技術進行深度優化,透過自訂量化與固態硬碟(SSD)串流等方式,大幅改善本地端模型的推論速度。

這則事件的發展

  1. 2026-08-28Qwen 3.8 Flash Next 架構解析:結合 N-gram 與 512 專家 MoE,將 51B 參數卸載至 SSD
  2. 2026-08-27阿里發布 Qwen3.8-Flash-Next 176B 模型權重,NVIDIA 宣布 GB300 NVL72 提供 Day-0 支援

來源

本期分類