模型發布
Liquid AI 發布 LFM2.5 Q4_0 量化感知蒸餾模型,恢復 97% BF16 精度
HuggingFace Blog綜合 3 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Liquid AI 於 Hugging Face 發布採用量化感知蒸餾(QAD)技術訓練的 LFM2.5 Q4_0 模型權重,涵蓋 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 與 LFM2.5-2.6B 四款規模。
透過將高精度教師模型蒸餾至量化學生模型,新檢查點在保留 Q4_0 GGUF 格式低記憶體占用與高吞吐量特性的同時,成功恢復因量化流失的 97% BF16 平均精度。四款模型分別保留了 97.1%、96.5%、97.4% 與 96.6% 的基準效能。
官方在 MacBook Pro、NucBox EVO-X2(GPU 推論)以及 Samsung Galaxy S26 Ultra、Raspberry Pi 5(Arm CPU 推論)等邊緣設備上進行實測。結果顯示,230M 與 350M 的 QAD Q4_0 模型品質媲美 Q5_K_M,且解碼吞吐量提升 4% 至 33%;1.2B 與 2.6B 模型則媲美 Q4_K_M 品質,吞吐量提升 3% 至 14%,並與 Unsloth 的 UD-Q4_K_XL 訓練後量化模型表現相當。
該系列模型目前已開放下載,支援 llama.cpp 及任何相容 GGUF Q4_0 格式的執行環境。
讀原始報導背景
量化感知蒸餾(Quantization-Aware Distillation, QAD)是一種將高精度教師模型蒸餾至量化學生模型的技術;該概念雖早已存在,但對現代大型語言模型展現出極佳的成效。GGUF 則是 llama.cpp 專案於 2023 年 8 月推出的二進位檔案格式,專為快速儲存與載入模型資料而設計。
來源
- X @liquidainitter.net
- Reddit r/LocalLLaMAreddit.com
- research.nvidia.com
- en.wikipedia.org