跳到主要內容
2026-08-09 日報
開發生態

SGLang 發布 v0.5.17,首日支援 2.8T 參數 Kimi K3 與 MiniMax-H3 影音生成模型,並初步導入 Rust 前端

GitHub sgl-project/sglang一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

SGLang 發布 v0.5.17 版本,首日即支援 2.8T 參數的多模態 LatentMoE 模型 Kimi K3 與 MiniMax-H3 影音生成模型。Kimi K3 具備 1M token 上下文,包含 69 層 KDA 線性注意力與 24 層 MLA 層;SGLang 為其提供原生 MXFP4 檢查點支援、DCP、DSpark 投機解碼及 OpenAI 相容 API,並已在 NVIDIA GB300 與 AMD MI35x 上完成驗證。MiniMax-H3 則可在單一請求中同步生成影片與立體聲音訊,透過 SGLang-Diffusion 原生部署,支援 B200、H100,並可透過逐層卸載(layerwise offload)在兩張 RTX 5090 上運行。 新版亦加入 EmbeddingGemma、LFM2.5 嵌入模型與 nvidia/MiniMax-M3-NVFP4 支援。在架構上,系統初步導入 Rust 前端,將網路入口至 GPU 排程器之間的前端處理從 Python 遷移至多執行緒 Rust 實作。 效能與基礎設施方面,新增 DWDP MoE 預填平行策略,透過 NVLink P2P 預取專家權重,在 4 張 B200 上運行 gpt-oss-120b 時,相較 DEP4 達 1.92 倍加速;同時加入權重快取守護行程(daemon),讓重啟的引擎可直接從快取恢復,省去重新載入權重與 CUDA graph 重新擷取的時間,將原本如 Qwen3-235B FP8 需 6.5 分鐘的重啟時間大幅縮短。此外,針對 DeepSeek-V4-Flash/Pro FP8 加入 SM90 上的 DeepGEMM MegaMoE A2A 路徑,並為代理工作負載新增具備 session_id 感知的統一基數快取(Radix Cache)以最佳化前綴保留。
讀原始報導

背景

SGLang 是由 LMSYS 等機構的研究人員所推出的開源框架,專為大型語言模型與多模態模型提供程式編寫與高吞吐量的推論伺服。本次更新重點支援了基於 LatentMoE 架構的模型,該架構的核心目標在於最佳化推論成本,以提升每單位浮點運算與參數的準確度。

來源

本期分類