跳到主要內容
2026-08-23 日報
開發生態

sglang 發布 v0.5.18:新增支援 Muse Glimmer 等 7 款模型,DeepSeek-V4-Pro B200 解碼 TPOT 降至 35.67ms

GitHub sgl-project/sglang一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

sgl-project 發布推論框架 sglang v0.5.18,此次更新合併了來自 212 位貢獻者的 710 項 PR。 在模型支援方面,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled 與 LongCat-Image 等 7 款模型;並提供 Qwen3.8 系列、Ling-3.0、Nemotron 3.5 Lightning、Dots3-Note 及 DeepSeek-V4-Pro-0813 的 Cookbook 範例。 效能最佳化包含多項關鍵升級: - **啟動重疊載入**:支援在 CUDA Graph 擷取時同步從儲存裝置載入 Checkpoint。啟用後,Qwen3-32B 在 H100 的啟動時間從預設的 84.8 秒降至 35.6 秒(加速 2.38 倍)。 - **TP LMHead All-to-All**:在純 DP dp-attention 下,將 allgather 與 scatter 簡化為單一 all-to-all 操作。DeepSeek-V4-Pro 在 B200 解碼時,LMHead 時間從 320us 降至 169us,TPOT 從 36.97ms 改善至 35.67ms。 - **純 Allreduce 替換**:未融合的 allreduce 節點改用 FlashInfer MNNVL 工作區取代 NCCL。DeepSeek-V4-Flash TP4 在 Blackwell 架構上小批次解碼效能提升達 6.9%,此功能在 DeepSeek-V3/V3.2/V4 已預設啟用。 系統與底層架構方面,統一了編譯核心快取目錄,將 Triton、FlashInfer、Inductor、DeepGEMM 與 CUDA 驅動快取集中至 `SGLANG_CACHE_DIR`。相依套件更新為 torch 2.13.0、triton 3.7.1、flashinfer 0.6.17 及 CuTeDSL 4.6.2,並修復了 FA4 在 Blackwell 上的啟動退化問題。 其他更新包含:Rust 伺服器新增對 Qwen VL 的原生多模態處理;推測解碼(Speculative Decoding)新增支援 inkling dspark 及 DSpark/DFlash 的 logprobs;CUDA Graph 完整支援 MLA 並允許 Kimi 架構使用可中斷的 prefill 圖;MoE 支援 Triton TMA up 並為 MiniMax-M3 實作共享與路由專家的重疊計算。
讀原始報導

背景

SGLang(Structured Generation Language)是由 LMSYS 等機構研究人員推出的開源框架,專為大型語言模型與多模態模型提供高效能的服務。該系統結合了用於結構化生成的 Python 內嵌語言與執行環境,旨在實現低延遲與高吞吐量的推論表現。

這則事件的發展

  1. 2026-08-09SGLang 發布 v0.5.17,首日支援 2.8T 參數 Kimi K3 與 MiniMax-H3 影音生成模型,並初步導入 Rust 前端

來源

本期分類