開發生態
sglang v0.5.19 發布:新增支援 Qwen3.8 與 Ling-3.0 等模型,並正式導入 Beam search 功能
GitHub sgl-project/sglang一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
sgl-project/sglang 發布 v0.5.19 版本,本次更新由 214 位貢獻者提交 786 個 PR。新版本大幅擴增支援模型陣容,包含 Qwen3.8 (2.4T-A95B) 與 27B 版本、dots3.note、Ling-3.0-flash/tiny、Spark2.5、MiniCPM-SALA、Granite 4.2,以及 Diffusion 模型 LongCat-Image-Edit 與 Edit-Turbo。
在核心功能方面,sglang 正式導入 Beam search,使用者可透過傳遞 `beam_width` 參數獲取 n 個最佳序列,但目前尚未能與推測解碼(speculative decoding)、分離式架構(disaggregation)、DP attention 或 HiCache 混合使用。統一基數樹(Unified radix tree)現已成為所有模型的預設快取,支援 PD 解碼工作節點重複使用快取前綴,並允許在運行中的伺服器掛載或卸載 L3 儲存。
針對推論效能與硬體最佳化,本次更新帶來多項顯著提升:
- **NVIDIA 架構**:支援 DeepEP v2 的 ElasticBuffer 引擎,允許 DeepSeek-V3/V4 與 Qwen3-MoE 在 FP8 精度下跨節點執行 CUDA graphs。在 Hopper 架構上,若部署 MXFP4 專家模型,可透過 FlashInfer 0.6.18 將啟動值量化為 FP8,使 DeepSeek-V4-Flash 輸出吞吐量提升約 12% 且不影響 GSM8K 準確率。此外,LayerNorm 序列平行化使每個張量平行(TP)節點僅正規化自身的 prefill token,在 H100 與 B200 上分別為 Qwen3-8B 節省 3.5% 與 5.6% 的 prefill 時間。
- **AMD 架構**:針對 MI300X 與 MI355X 導入持久化 Lean attention 核心,最高提升 1.52 倍吞吐量並降低 3.62 倍 token 間延遲。ROCm 上的分離式 GLM-5.2 部署透過融合 top-k seed remap,將八張 MI355X 的解碼 TPOT 從 23 毫秒大幅降至 8 毫秒。
- **推測解碼(Speculative Decoding)**:DSA prefill top-k 升級至 v2 核心,在 B200 上速度提升 1.3 至 1.8 倍。KDA 模型新增融合接受路徑(fused accept path),在 Kimi-Linear 形狀上可減少 45% 至 63% 的 MTP 驗證與提交時間。DFlash2 在 batch 1 下比無推測解碼快 3.43 倍。
Cookbook 亦同步更新多項硬體部署指南,包含在 Ascend A3 部署 Kimi-K3、在 MI355X 部署 Kimi-K2.7-Code-MXFP4,以及在 RTX 5090 與 DGX Spark 上重新測量的 Qwen3.8-27B 效能數據。依賴項方面,FlashInfer 升級至 0.6.18,並提供針對 Rubin 架構的 CUDA 13.4 預覽版映像檔及多款 ROCm 10 映像檔。
讀原始報導背景
SGLang(Structured Generation Language)是由 LMSYS 等機構研究人員推出的開源框架,專門用於編寫與部署大型語言模型及多模態模型。該系統結合了用於結構化生成的 Python 嵌入語言以及高吞吐量的推論執行環境(runtime),旨在提供低延遲與高吞吐量的效能。
這則事件的發展
來源
本期分類