實測揭露本地部署 LLM 效能衰退元兇:推理軟體堆疊差異導致長文本 Token 翻轉,NVIDIA NVFP4 錯誤率近半論壇用戶測試 Qwen3.6-27B 發現,將 KV 快取降至 INT4 會導致工具呼叫徹底失敗,且張量平行度與 NCCL 跨卡通訊差異皆會引發數值偏移。量子位單一來源