跳到主要內容
2026-10-03 日報
開發生態

SGLang 發布 v0.5.21:支援 DeepSeek-V4.1 Flash 與 Kimi K3,PD 實例可即時切換 Prefill 與 Decode

GitHub sgl-project/sglang一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

SGLang 框架發布 v0.5.21 版本,新增支援 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等 LLM/VLM,以及 Qwen-Image 2.1、FLUX 3 Action 等 Diffusion 模型。在核心功能方面,PD 實例現可即時切換 prefill 與 decode 階段而無需重啟,且 Prefix cache 預設改由 Rust 核心執行。 效能數據顯示,DeepSeek-V4.1 在長提示詞下的首字延遲加快 22%,Kimi K3 在 PD 部署中的 prefill 吞吐量提升 20.6%。硬體與生態方面,GLM-5.3-Flash 現可於 AMD MI355X 運行,支援 FP8 / MXFP4 MoE 與 MTP 投機解碼(speculative decoding);並支援在 ComfyUI 中透過 SGLang Diffusion 執行 MiniMax-H3。 API 部分新增 Decisions API(`/v1/decisions`)將模型轉為低延遲分類器,以及 Score API(`/v1/score`)以單次請求為所有候選項目評分。投機解碼功能亦獲擴充,包含 LFM2-VL 的 DSpark 投機解碼(batch 1 速度提升 1.66 倍至 2.56 倍)及 Kimi K3 的 DFLASH 支援。官方已釋出支援 NVIDIA (CUDA 13)、AMD MI35x/MI30x (ROCm 10) 及 Intel GPU/CPU 的 Docker 映像檔。
讀原始報導
本期分類