研究與評測
開發者透過自研核心讓四張 V100 原生執行 Qwen 3.8 NVFP4,解碼速度匹敵 RTX 5090
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/LocalLLaMA 論壇開發者披露,其透過自研核心成功讓四張 2017 年的 Tesla V100 GPU 原生執行 Qwen 3.8 NVFP4 模型,解碼效能匹敵 RTX 5090。官方文件顯示,NVFP4 是 NVIDIA 為 Blackwell 架構設計的三種主要 4 位元浮點數格式之一(另含 FP4 與 MXFP4),而 RTX 5090 具備 FP4 與 FP8 的原生硬體支援,V100 則兩者皆無。開發者編寫了名為 QPN 的自訂核心,在從 HBM 讀取模型時保持壓縮狀態,並將片段直接轉換為 Volta 架構 Tensor Cores 可處理的 FP16 暫存器格式,省去大規模反量化步驟。在 AIME 2026 測試中,四張 V100 達成 219.1 ± 5.9 tok/s 的解碼吞吐量,微幅領先執行 NInfer 引擎的 RTX 5090(214.7 ± 9.2 tok/s)。儘管 RTX 5090 單輪延遲較低(19.9 ms 對比 V100 的 26.9 ms),但 V100 系統利用 Qwen 3.8 內建的 MTP 並將深度設為 k=7,每輪可提交 5.89 個 token,高於 RTX 5090 的 4.27 個,從而抵銷了單輪速度劣勢。該專案(v100-skinny)最新 v1.1 版本進一步支援直接載入官方發布的混合 FP4/FP8 權重,無需修改檢查點即可執行。
讀原始報導背景
NVFP4 是專為 NVIDIA 第五代 Blackwell 架構 Tensor Cores 所設計的 4 位元浮點數格式。而新聞中作為對照組的 NInfer,則是一款專門針對單張 RTX 5090 執行特定 Qwen 模型所打造的推論引擎。