開發生態
SGLang 推出多模態與語音推論框架 SGLang-Omni,首日支援 MiniMax Music 3 與 Qwen3-Omni
GitHub Trending (python)單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
SGLang 團隊推出針對多模態、語音與 TTS 模型的推論服務框架 SGLang-Omni,v0.1.1 版已於 PyPI 上架。該版本包含 TTS 架構重構,涵蓋共享管線狀態、引擎建構與聲碼器排程等更新。
SGLang-Omni 的核心設計為「多階段解碼(Multi-stage decoding)」,將生成過程拆分為預處理、編碼器、自迴歸引擎與聲碼器等異質階段,並為各階段的工作負載配置專屬排程器。在執行層面,控制平面負責協調請求,資料平面則透過共享記憶體、NCCL、NIXL 與 Mooncake 後端進行張量傳輸。
該框架提供相容 OpenAI 的 API 端點,支援多模態聊天、批次與串流語音生成及語音轉錄。模型支援涵蓋 Qwen3-Omni 與 Ming-Omni 等多模態模型;語音生成支援 Higgs Audio v3、MOSS-TTS、Fish Speech S2-Pro 等;語音轉錄則支援 Qwen3-ASR、Fun-ASR,以及具備語者標籤與時間戳記功能的 MOSS-Transcribe-Diarize。此外,框架首日即支援 MiniMax Music 3 音樂生成模型,可依歌詞與提示詞生成 32 kHz 立體聲歌曲,最高可生成長達 5 分鐘的完整歌曲。
硬體後端預設支援 NVIDIA CUDA,並透過 PyTorch XPU 提供對 Intel GPU 的實驗性支援,目前已可端到端運行 Qwen3 系列的 ASR、TTS 與 Omni 模型。
讀原始報導背景
SGLang(Structured Generation Language)是由 LMSYS 等機構的研究人員所推出的開源框架,專為大型語言與多模態模型提供低延遲、高吞吐量的推論服務。此次引發關注的 SGLang-Omni 則是其針對全模態、語音與文字轉語音(TTS)模型所設計的多階段服務執行環境。