開發生態
Hugging Face Transformers 原生支援 llama.cpp GGUF 量化模型,初期專注 Apple Silicon 部署
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Hugging Face 宣布 `transformers` 函式庫現已原生支援執行 `llama.cpp` 的 GGUF 量化模型。為使效能貼近 `llama.cpp`,該更新透過 `kernels` 函式庫重複使用底層的 `ggml` 核心,並減少生成時的額外負擔。
初期支援專注於 Apple Silicon 設備的本地端推論,並以 Qwen3.5 架構為首波支援對象。開發者只需在 `from_pretrained` 中傳入 Hub 的 `model_id` 與 `gguf_file` 檔名即可載入模型,無需額外設定。若系統無法取得相容的量化核心,載入器將退回至解量化(dequantizing)模式並佔用更多記憶體,注意力機制則會退回使用「sdpa」。
此外,使用者可透過 `transformers serve` 指令直接部署 GGUF 模型,提供 OpenAI 相容 API,以便與 Jan 或 Pi 等第三方對話介面介接。官方建議本地端推論可從 Q4_K_M 量化版本開始嘗試,以取得記憶體佔用與精度的平衡。
讀原始報導