開發生態
社群開發者釋出 Mac 最佳化版 Qwen3.8-Flash-Next,M1 Max 實測 Prefill 達 190 tps
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群 r/LocalLLaMA 開發者分享,其針對 Mac 環境深度最佳化 Qwen3.8-Flash-Next 推論效能,並已於 GitHub 釋出修改版的 llama.cpp 分支。在 M1 Max 64GB 設備實測中,透過開啟 MTP(Multi-Token Prediction)與快取最佳化,Prefill 速度最高可達 185-190 tps。
該專案的核心技術包含:為張量、engrams 與 MTP 導入 SSD 串流;混合 Unsloth 與 AtomicChat 量化權重打造自訂 Q4 版本,以達到最佳效能位元比;以及開發 Metal 最佳化的稀疏注意力機制,將 llama.cpp 原本的二次方效能衰減改善為近乎線性。
在記憶體管理方面,專案採用 Q4_0 MTP,以一半記憶體達成與 Unsloth Q8_0 相同的接受率,並支援動態 MTP 預測大小調整,當上下文長度過大時會自動停用 MTP 以節省 KV 快取空間。
開發者實測指出,開啟 MTP 雖會佔用更多記憶體,使 4K 文本的 Prefill 降至 170 tps,256K 長文本降至 150 tps,但解碼(Decode)效能可大幅提升 70% 達 22 btps。開發者亦透露,該專案歷時三週,開發過程大量依賴 Claude 輔助完成。
讀原始報導背景
多詞元預測(Multi-Token Prediction,簡稱 MTP)是一種新興技術,能讓語言或多模態模型同時預測多個詞元,藉此提升模型的效率與能力。近期有開發者針對 Mac 裝置與 MTP 技術進行深度優化,透過自訂量化與固態硬碟(SSD)串流等方式,大幅改善本地端模型的推論速度。
這則事件的發展
來源
本期分類