模型發布
Meta 發布 30B 本地代理模型 Muse Glimmer:採 Apache 2.0 授權,4-bit 量化可於 24GB 單卡運行
Hacker News綜合 9 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
Meta 發布專為本地 AI 代理工作流程最佳化的 30B 參數模型 Muse Glimmer,並首度捨棄過去 Llama 家族的 7 億用戶限制,改採無限制的 Apache 2.0 授權。該模型是 Meta 於四月推出的閉源模型 Muse Spark 的開源版本,透過 logit 蒸餾技術將大型教師模型的代理推理能力轉移至緊湊架構中,並支援超過 100 種語言。Muse Glimmer 具備端到端任務完成、精確工具呼叫、多步驟推理與錯誤自動重試能力,並內建專用感知編碼器以支援圖文交錯的多模態輸入。為適應消費級硬體,Meta 將模型權重進行約 4-bit 量化,使語言模型體積縮減至 20GB 以下(開發者實測約 18.16GB),確保在 24GB 或 32GB 記憶體的單張 GPU 上,能同時運行 KV cache、感知編碼器與推測解碼(Speculative Decoding)模組。在生成速度方面,其內建基於 DFlash 的輕量級草稿模型,可一次提出多個 token 區塊供主模型驗證;官方預計近日將完成 llama.cpp、MLX 與 ExecuTorch 的整合。在 DeepSearch QA、MCP-Atlas、𝛕-Bench 與 SWE-Bench 等代理基準測試中,Muse Glimmer 展現出對標同級別 Gemma4-31B 及 Qwen3.6-27B 的效能。
讀原始報導背景
llama.cpp 是一個以 C/C++ 撰寫的開源推論引擎,專為在本地端高效執行大型語言模型而設計。它與 GGML 張量函式庫共同開發,目前已被廣泛視為幾乎所有本地推論工具的核心標準。
社群討論
社群對 Meta 推出 30B 代理模型持正面態度,實測顯示其在 7900XT(20GB VRAM)上能達到 700 tok/s 提示與 36 tok/s 生成速度,且思考效率優於 Qwen3.6 27B。然而,部分網友質疑硬體成本過高(如需 32-64GB RAM 或昂貴的 RTX 5090),認為不如直接使用雲端 API 划算,並預期即將推出的 Qwen3.8 27B 將會超越它。此外,也有人對 Meta 的隱私保護抱持強烈不信任,並重申「開放權重(open weight)」不等於真正的開源。
來源
- Ars Technica AIarstechnica.com
- X @AIatMetanitter.net
- X @ArtificialAnlysnitter.net
- X @MetaforDevsnitter.net
- Simon Willisonsimonwillison.net
- TechCrunch AItechcrunch.com
- VentureBeatventurebeat.com
- Hacker Newsft.com
- Reddit r/LocalLLaMAreddit.com
- en.wikipedia.org
- github.com