跳到主要內容
2026-07-25 日報
研究與評測

SGLang v0.5.16強化推論

GitHub sgl-project/sglang
SGLang v0.5.16 上線,加入信心驅動的 DSpark 推測解碼,並支援具 975B 參數、1M token context 的多模態 MoE 模型 Inkling。DSpark 在 DeepSeek-V4-Pro、B300 TP8、bs=1 下達 383.7 tok/s;新版也將特定 GLM-5.2 設定的每 rank KV 記憶體由 0.77 GB 降至 0.20 GB,並把 ReplaySSM 推測暫存從每張 GPU 11.5 GB 降至 1.8 GB。升級時須注意 QServe、FBGEMM FP8 等路徑已移除,多個旗標與端點格式亦有破壞性變更,且仍存在 temperature-0 非確定性與 Mamba 排程問題。
讀原始報導

背景

SGLang 的快取架構採元件化、可插拔設計,將 Full-attention、Sliding-Window-Attention(SWA)與 Mamba/SSM 快取統一至單一 radix tree;UnifiedRadixTree 目前也是 SWA、Mamba 與 DSA 模型的預設值。此次加入的 DSpark 是信心驅動的推測解碼演算法,會以半自迴歸方式分區塊產生草稿,再依草稿信心動態調整驗證視窗,而非採用固定草稿長度。

來源