跳到主要內容
2026-08-22 日報
模型發布

據報 llama.cpp 提交 PR 支援多模態 MoE 模型 dots3-note,具備 280B 參數與 512K 上下文

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據社群消息指出,開源推論框架 llama.cpp 近期出現一項 Pull Request(#27060),準備新增對 dots3-note preview 模型的支援。該模型為 dots3 系列首款開放權重(open-weight)模型,採用混合專家(MoE)架構,總參數達 280B,每次推論啟動參數為 16B。此外,模型支援高達 512K tokens 的上下文長度,具備多模態理解能力,可接收文字、影像、影片與音訊輸入,並產生文字輸出。
讀原始報導

背景

llama.cpp 是一個開源的高效能 C/C++ 推論引擎,專為在本地端執行大型語言模型而設計,並廣泛支援 GGUF 格式。它與通用張量函式庫 GGML 共同開發,目前已被視為幾乎所有本地推論工具的核心標準。

這則事件的發展

  1. 2026-08-20llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s
  2. 2026-08-18llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%
  3. 2026-08-10社群釋出 llama.cpp 修補程式修正 MTP 記憶體高估,AMD 雙卡執行 Qwen 27B 上下文從 64K 提升至 149K
  4. 2026-08-08llama.cpp 提交新 PR 最佳化 x86 CPU,Q2_0 推論速度提升達 3.6 倍

來源