跳到主要內容
2026-07-23 日報
模型發布

Bonsai 27B登上HF熱門

HF Trending
Prism ML 的 Ternary Bonsai 27B GGUF 開放權重模型登上 Hugging Face 熱門,採端到端三元 Transformer 權重,部署占用約 7.2 GB。官方資料稱其保留 95% 的 FP16 能力、支援 262K-token 上下文,並可透過 llama.cpp、vLLM、Ollama 等工具在 CUDA、Metal 與 CPU 上推論。其 GGUF 格式使用 llama.cpp 自訂 2-bit hybrid-attention kernels,權重可直接運算而無須展開回 FP16。
讀原始報導

背景

GGUF(GPT-Generated Unified Format)是由 llama.cpp 創辦人 Georgi Gerganov 定義並發布的大型語言模型檔案格式,針對快速載入、儲存與高效率推論最佳化。新聞列出的 vLLM 則是強調高吞吐量與記憶體效率的大型語言模型推論及服務引擎,可用於部署這類模型。

來源