模型發布
PrismML 開源 Ternary Bonsai 2 27B 模型:採三進制權重壓縮至 5.9GB,保留 Qwen3.8 98.2% 效能
Hacker News綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
.png)
PrismML 發布並以 Apache 2.0 授權開源 Ternary Bonsai 2 27B 多模態模型。該模型基於阿里開源的 Qwen3.8 27B(補充資料顯示 Qwen3.8 建立在 Qwen3.5 架構上,為首次釋出 Qwen-Max 等級模型),透過三進制({-1, 0, +1})權重與 FP16 分組縮放技術,將單一權重壓縮至 1.76 有效位元。整體模型大小僅 5.9GB,體積較原模型縮小逾 9 倍。
效能與規格方面,Ternary Bonsai 2 27B 支援 262K 脈絡視窗與圖文多模態輸入。在涵蓋推論、數學、程式碼與代理工具使用的基準測試中,該模型獲得 83.9 分,保留了全精度 Qwen3.8 27B 高達 98.2% 的綜合效能(前代 Bonsai 27B 僅保留 95%),在程式碼與長文本代理任務中實現近乎無損的壓縮。
運行效率上,該模型可透過 CUDA 在 NVIDIA GPU 及透過 MLX 在蘋果裝置(Mac、iPhone、iPad)上運行。實測顯示,在 NVIDIA RTX 5090 上吞吐量達 143 tokens/second,M5 Max 上為 46.8 tokens/second;在 RTX 4090 上每 token 僅消耗 0.714 mWh,能效比全精度的 8B 模型高出 40%。
據 TechCrunch 報導,由加州理工學院(Caltech)研究人員創立的 PrismML 已獲得 2225 萬美元種子輪融資,投資方包含 Khosla Ventures、Cerberus、Google 與三星。此外,有消息指出 PrismML 正與蘋果洽談合作,但執行長 Babak Hassibi 對此拒絕評論。
讀原始報導背景
Bonsai 2 27B 的基礎模型 Qwen3.8 是由阿里雲(Alibaba Cloud)所開發的大型語言模型。該模型透過三元量化(Ternary Quantization)技術將權重壓縮至極低位元,能在保留強大效能的同時,大幅降低在裝置端部署的記憶體佔用。
社群討論
社群高度讚賞 Bonsai 2 27B 讓 27B 模型能在 16GB 設備甚至瀏覽器運行,實測在 RTX 5090 達 143 tok/s,RTX 4090 功耗僅 0.714 mWh/token。然而,許多人質疑其 1.76 bpw 的極端壓縮如何避免常規低於 4bpw 的嚴重衰退,並指出模型在處理長任務時容易崩潰。儘管官方稱性能媲美 UD-Q4_K_XL,但也有實測顯示 Mac Mini M2 僅有 7-8 tok/s,且在 DGX Spark 上受限於記憶體頻寬僅達 34.38 tok/s。
來源
- TechCrunch AItechcrunch.com
- en.wikipedia.org
- github.com
- arxiv.org