跳到主要內容
2026-09-05 日報
開發生態

開發者推出三元模型專用 GGUF 格式 Q2_B3,透過 Base-3 打包無損降低 22% VRAM 佔用

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群報導,開發者釋出針對三元模型(如 BitNet-b1.58 或 Ternary-Bonsai)設計的 GGUF 格式 Q2_B3(或稱 B3S),可無損降低約 22% 的模型權重體積。 該格式採用 Base-3 直接打包三種權重狀態(-1, 0, +1)。每區塊 128 個權重,由 26 bytes 的 trits 與 1 個 f16 scale 組成,總計每區塊 28 bytes,相當於每個權重僅佔用 1.75 bits。 在純權重體積上,9B 模型從約 2.5 GB(Q2_0)降至 2.0 GB,27B 模型從約 7.6 GB 降至 5.9 GB。開發者強調這並非通用的 2-bit 量化器,僅適用於原生三元模型,若用於一般 FP16 模型將導致輸出品質崩壞。 該實作基於 `llama.cpp` 分支開發。後端支援方面,AMD ROCm(於 RDNA3/7900 XTX 調校)與 CPU 已確認可用,且初步測試無明顯解碼降速;NVIDIA CUDA 與 Apple Metal 雖已完成程式碼編譯,但因開發者缺乏硬體,尚未經實機驗證。專案另提供重包裝工具(repacker),可將舊版 30-byte 佈局的 Q2_B3 檔案安全轉換為最新的 28-byte 格式。
讀原始報導
本期分類