SGLang v0.5.16強化推論
SGLang v0.5.16 上線,加入信心驅動的 DSpark 推測解碼,並支援具 975B 參數、1M token context 的多模態 MoE 模型 Inkling。
GitHub sgl-project/sglang
22 則值得知道的變化
SGLang v0.5.16 上線,加入信心驅動的 DSpark 推測解碼,並支援具 975B 參數、1M token context 的多模態 MoE 模型 Inkling。
據量子位報導,Vivix發布即時互動多模態模型A1與W1,以原生流式架構支援持續音訊、影片生成及即時介入。Vivix稱,近30B活化參數的A1可在消費級GPU即時推論,平均可見反應延遲低於0.6秒,單卡吞吐量超過10000 video tokens/s。相關效能目前主要來自Vivix技術資料,產品已開放測試申請。