模型發布
Unsloth 發布 Dynamic 3.0 GGUF 量化技術,Qwen3.8-27B 同體積準確率提升逾 10%
Hacker News綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。

Unsloth 正式發布 Dynamic v3.0 GGUF 量化技術,並首波釋出 Qwen3.8-27B 模型權重,在相同檔案大小下,其 top-1% 準確率較其他提供者提升超過 10%。新版 3.0 GGUF 支援 llama.cpp 與 Unsloth Desktop 等主流推論引擎,且 Unsloth Qwen3.8 在 5 天內下載量已突破 510 萬次。
該技術完全採用純訓練後量化(PTQ),不使用 QAT 或 QAD,並導入針對代理程式開發、對話與多語系最佳化的全新 imatrix 校準資料集(官方已開放此檔案供社群使用)。為避免過度擬合並更準確評估推論能力,Unsloth 引入「Divergence-300 @32」新指標,從 Terminal-Bench 2.1、DeepSWE 等資料集抽取 300 個未見過的提示詞,與 BF16 進行 32 token 的貪婪解碼對比,證明新方法在 KL 散度上表現更佳;不過針對較大體積的量化版本,目前仍沿用 Dynamic v2.0 技術。
在具體版本規格上,8.37GB 以下的較小量化版本移除了 MTP 模組以節省約 500MB 空間(提供獨立的 Q4_0 MTP 模組);9.83GB 的 UD-Q2_K_XL 版本 top-1% 準確率較競品高出 8%。針對極端量化的 1-bit 版本,官方公告指出 6.2GB 的 UD-IQ1_S 保留約 72% 準確率,但其在 Reddit 的貼文則稱 1-bit 版本保留 77% 準確率,並可在 8GB 記憶體運行。
此外,Unsloth 團隊在 Reddit 澄清,稍早替換模型檔案純粹是為了進一步提升效能,嚴正駁斥社群中關於「模型損壞需要修復」的捏造傳言。
讀原始報導背景
GGUF(GGML Universal File)是由 llama.cpp 專案於 2023 年 8 月推出的二進位檔案格式,能將張量與 metadata 儲存於單一檔案中,以利快速儲存與載入模型資料。在進行模型量化時,通常會搭配重要性矩陣(imatrix)與校準資料集,藉此盡可能減少量化過程中所產生的誤差。
社群討論
社群高度讚賞 Unsloth Dynamic 3.0 的體積與效能優化,開發者亦澄清為適應 8GB 設備,僅在 8GiB 以下版本移除約 500-750MiB 的 MTP 模組;實測顯示 IQ4XS 在 4090 16GB 運行順暢,且 Qwen3.8-27B(如 Q4_K_P 耗時 3 小時解出 CTF)的無限迴圈問題已大幅改善。然而,針對 6.2GB 的 1-bit 等極低位元量化,部分用戶質疑微小誤差會隨長文本快速累積導致崩潰,認為實用性不如直接跑 9B 模型,同時也有人抱怨缺乏版本號導致同名檔案管理混亂。