模型發布
LiquidAI 發布 LFM2.5-DSpark 推測解碼模型,GPU 推論最高加速 3.18 倍並首日支援 SGLang 與 llama.cpp
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

LiquidAI 推出 LFM2.5-DSpark,透過推測解碼(Speculative decoding)技術解決 LLM 推論時的記憶體頻寬瓶頸,使 GPU 吞吐量最高提升 3.18 倍,裝置端最高提升 2.87 倍。該模型首日即開源整合至 upstream,支援 llama.cpp 與 SGLang。
DSpark 架構結合三個組件:基於目標模型上下文特徵的 DFlash 風格平行骨幹、增加 token 間依賴性的輕量級馬可夫鏈頭(Markov head),以及可修剪低信心度後綴的信心排程驗證器。其草稿模型參數約 300M,包含 5 層注意力層,訓練時以最高接受率而非最低損失為選擇標準。在貪婪解碼下,其準確率(pass@1 或 exact match)與基準模型完全一致。
在 H100 80GB (BF16, SGLang) 測試中,LFM2.5-2.6B 平均加速 2.67 倍(達 864 tok/s),並在多工具場景中使函數呼叫延遲平均降低 57%;LFM2.5-1.2B-Instruct 平均加速 2.10 倍。在 M4 Max MacBook Pro (FP16 GGUF, llama.cpp) 測試中,LFM2.5-1.2B-Instruct 最高加速 2.87 倍(達 389 tok/s)。
值得注意的是,LFM2.5-8B-A1B 雖在 H100 上創下 3.18 倍的最高加速(達 1362 tok/s),但在裝置端平均僅提升 18%。官方指出,此落差源於 llama.cpp 的 Metal 後端 MoE 實作限制,且驗證多個 token 會啟動更多專家,進而增加權重傳輸負載。
讀原始報導背景
SGLang 是一個專為大型語言模型與多模態模型設計的開源推論框架,由 LMSYS 等機構的研究人員開發。該框架結合了結構化生成與高吞吐量的執行環境,旨在提供低延遲的推論服務。