模型發布
ByteShape 發布 Qwen 3.8 27B 完整 ShapeLearn 量化模型,GPU-5 達 BF16 99.63% 效能
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,ByteShape 發布了 Qwen 3.8 27B 的完整 ShapeLearn 量化模型(GGUF 格式),取代先前最佳化預算較小的 ShapeLearn-Lite 版本。
官方推薦使用 GPU-5(IQ4_XS-3.84bpw),佔用 13.1 GB VRAM,在 RTX Pro 6000 上可達 90.4 tok/s,並保留 BF16 基準分數的 99.63%。若記憶體受限,GPU-4(IQ3_S-3.23bpw)佔用 11.0 GB,可達 98.72% 的 BF16 分數且速度更快。
模型支援推測解碼以提升吞吐量。MTP 草稿模型已內建於每個 GGUF 中,適合需要多模態支援或 VRAM 受限的場景;DFlash2 則需額外載入 1.1 GB 草稿模型及 llama.cpp b10658 以上版本,提供更高的純文字吞吐量。
在六款 GPU 的測試中,五款 ShapeLearn 模型均處於品質與速度的最佳邊界。對比其他團隊,ISTA-DASLab 的模型同樣位於邊界上;Prism-ML Ternary Bonsai 2 體積最小且速度最快(1.77 BPW),但準確率降至 91.4%,且需使用自訂版 llama.cpp 執行。
讀原始報導社群討論
社群主要針對不同硬體實測推論速度,發現效能高度依賴記憶體頻寬,且部分 AMD 使用者反映其速度並未超越 Unsloth 模型。實測數據顯示,在 7900 XTX 上將 draft tokens 設為 3 後,Draft 速度可達 67 t/s(略勝 MTP 的 64 t/s),而 R9700 使用者則測出最高 80 t/s 的效能。此外,針對模型答錯冷門硬體規格,有人反駁這類小型模型不該用來測試冷知識,應交由 tool calling 處理。