跳到主要內容
2026-09-22 日報
研究與評測

社群開發者擴展 Splash 引擎,Apple Silicon 執行 Qwen3.8-27B 原生 8-bit 推論達 37-55 tok/s

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群開發者發布的未經驗證實測,專為 Apple Silicon 設計的 C++ 與 Metal 投機解碼引擎 Splash 已被擴展支援原生 8-bit 模型。該分支版本新增了 schema 5 (MDFL0008) 載入與 Metal Q8 核心,旨在解決 4-bit 量化在數學與多步驟推導上遭遇的「推理懸崖(reasoning cliff)」問題,同時向下相容官方的 4-bit 模型。 在配備 64 GB 統一記憶體的 Apple Silicon (M5 Pro) 上執行 Qwen3.8-27B 模型,原生 8-bit (Splash-HQ) 平均生成速度達 36.9 tok/s,在數學邏輯任務最高達 54.8 tok/s,較基礎的 MLX 或 llama.cpp (9.9 tok/s) 提升約 3.73 倍,也優於 MTPLX-Q8 的 26.5 tok/s。 測試揭露了一項「精度與速度悖論」:27 GB 的未壓縮原生 8-bit 模型平均速度(36.9 tok/s)微幅超越 17 GB 的壓縮 8-bit 版本(36.5 tok/s)。原因在於原生 8-bit 產生更精確的 logits,提高了投機解碼的草稿接受率(draft acceptance)並減少驗證回退(rollbacks),從而抵銷了較高的記憶體讀取負擔。 此外,實測指出 Qwen3.8 採用混合架構(包含 48 層循環線性 DeltaNet),使其在擴展至 256k 脈絡長度時,記憶體能維持 O(1) 增長,避免了傳統 Transformer 的降速問題。相關模型權重與基準測試日誌均已公開。
讀原始報導
本期分類