跳到主要內容
2026-09-09 日報
研究與評測

網友實測 Qwen3.8-Flash-Next 推論引擎:262K 滿載 SGLang 首字延遲 35 秒,較 llama.cpp 快 7.3 倍

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit r/LocalLLaMA 社群網友實測,Qwen3.8-Flash-Next 模型在不同推論引擎上的效能表現差異顯著。測試環境採用 NVIDIA RTX PRO 6000 Blackwell(96GB VRAM)與 AMD Ryzen 9 9950X,llama.cpp 使用 UD-IQ4_XS GGUF 格式,SGLang 與 FreeToken 則使用 NVFP4 格式。在 262K 完整上下文視窗下,SGLang 的首字延遲僅 35.4 秒,FreeToken 為 80.4 秒,llama.cpp MTP 分支為 210.2 秒,而 llama.cpp 基準版本則需 258.4 秒,最快與最慢相差達 7.3 倍。在上下文長度掃描測試中,llama.cpp 的解碼速度從 101.9 tok/s 陡降至 20.2 tok/s,而 FreeToken 則維持在 100.1 至 94.8 tok/s 的平穩表現。此外,llama.cpp 的 MTP(推測解碼)分支在 8K 與 32K 程式碼測試中,解碼速度分別提升 1.63 倍與 1.69 倍;但在啟動速度上,llama.cpp 僅需 16 秒即可輸出,遠快於 SGLang 的 108 秒與 FreeToken 的 126 秒。實測也顯示,各引擎在 GSM8K(95.22–95.75%)與 MATH-500(92.20–93.00%)的跑分結果並無顯著差異。
讀原始報導
本期分類