跳到主要內容
2026-09-05 日報
模型發布

Minima 釋出全 NVFP4 W4A4 量化版 Qwen3.8-27B,打破混合架構限制,體積縮至 17.5 GiB 且效能持平 BF16

HF Daily Papers一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Minima 團隊發布 `minima-ai/mnma_qwen3.8_27b_nvfp4` 模型,將 Qwen3.8-27B 的 496 個線性層(包含 Gated DeltaNet 循環層與其閘門投影)全部進行 NVFP4 W4A4 量化。過去社群認為混合架構的循環層過於脆弱,多保留在 8-bit 或 16-bit 精度,但該研究透過僅校準的訓練後量化(PTQ),證實量化雜訊不會在循環狀態中累積。實測顯示,該模型在單張 96GB Blackwell GPU 上運行,體積縮減至 17.5 GiB,在 MMLU-Pro、GSM8K、AIME'25 等基準測試中,效能與 BF16 基準的差距在隨機雜訊範圍內,且預填充(prefill)速度較 Unsloth 等部分量化版本提升 14% 至 19%。研究指出,NVFP4 的 16 元素區塊縮放能局部化極端離群值,且 Delta 規則會沿新鍵值方向覆蓋狀態,使注入誤差在數百個 token 內被遺忘,32K 脈絡下的困惑度差距甚至會隨位置縮小;被認為脆弱的閘門投影實際上最不敏感,其 softplus 與 sigmoid 參數化能將約 11% 的 GEMM 誤差壓縮至約 2% 的輸出誤差。此外,團隊修復了將 GDN 投影融合為單一 GEMM 時導致的縮放失配問題,釋出的權重已預先協調,可直接正確部署。
讀原始報導

背景

Gated DeltaNet 是一種線性注意力架構,在語言模型等基準測試中的表現超越了 Mamba2 等現有模型。NVFP4 則是一種區塊浮點(Block floating point)格式,透過讓多個有效位數共用單一指數來節省硬體空間。過去社群普遍認為混合模型中的 Gated DeltaNet 循環層過於脆弱,因此在進行 4-bit 量化時通常會為其保留較高的精度。

來源

本期分類