研究與評測
實測揭露本地部署 LLM 效能衰退元兇:推理軟體堆疊差異導致長文本 Token 翻轉,NVIDIA NVFP4 錯誤率近半
量子位單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Level1Techs 論壇用戶 thr3e 透過 Qwen3.6-27B 在 RTX PRO 6000 Blackwell 顯示卡上進行超過 10 萬 token 的全量 logit 捕獲測試,證實本地部署模型效能衰退源於推理軟體堆疊的微小數值差異。
在 vLLM 中保持權重與硬體不變,僅切換注意力後端(FlashAttention 2、Flash Infer、Triton Attention),前幾千 token 輸出一致,但隨上下文增長會出現「Top-1 翻轉」。例如 FlashAttention 2 在工具呼叫時生成了錯誤的 Cisco 路由器介面名稱(將 GigabitEthernet0/0/1.201 誤植為 GigabitEthernet0/1/4)。
固定 Triton 後端測試 KV 快取精度,BF16 全程穩定;INT8 在出錯後能掙扎恢復;INT4 則在長上下文中 Top-1 翻轉率急劇攀升,導致工具呼叫徹底失敗且無法自我糾正。
比較五種權重量化方案,社群版 TheHouseOfTheDude INT8 (W8A16) 因保留 BF16 激活精度,Top-1 一致性擊敗 Qwen 官方 FP8 與 NVIDIA 官方 NVFP4。NVIDIA NVFP4 表現最差,在 88k 上下文時 Top-1 翻轉率逼近 50%,與 AWQ W4A16 同樣未能正確關閉工具呼叫並執行了錯誤語法。
測試也發現,同一份 BF16 權重在 TP1(單卡)與 TP4(四卡)成功,但 TP2(雙卡)失敗,主因為 NCCL 跨卡歸約操作的數值差異。vLLM nightly 容器包含 734 個軟體包,不同硬體與配置的路徑差異會在長上下文中累積數值偏移,導致模型在關鍵時刻決策錯誤。
讀原始報導背景
vLLM 是一個開源的大型語言模型推論與服務框架,最初由加州大學柏克萊分校開發,其核心技術 PagedAttention 能有效管理 Transformer 模型的 KV 快取記憶體。而 FlashAttention 則是一種能提升注意力機制運算速度並節省記憶體的演算法。