研究與評測
Diffusers整合Nunchaku 4位元推論
HuggingFace Blog
Hugging Face 將 Nunchaku Lite 的 SVDQuant 4-bit W4A4 推論原生整合進 Diffusers,可透過 from_pretrained() 載入,無須另裝推論引擎或在本機編譯 CUDA。相較 BF16,這套方案可顯著降低 VRAM 用量,並在缺少架構專屬融合核心的情況下提供約 30% 加速。NVFP4 檢查點僅支援 NVIDIA Blackwell GPU,較早世代硬體須改用 INT4 版本。
讀原始報導背景
Nunchaku 是面向低位元神經網路的高效能推論引擎,採用 SVDQuant 訓練後量化技術,將權重與活化值量化為 4 位元,同時維持視覺保真度。如今 SVDQuant 的 W4A4 量化已透過 Nunchaku Lite 原生整合至 Hugging Face Diffusers,預量化檢查點可直接以 `from_pretrained()` 載入,且核心會透過 `kernels` 套件從 Hub 取得,無須在本機編譯 CUDA。