跳到主要內容
2026-08-23 日報
開發生態

Llama.cpp 釋出 0.2.0 版本,同步提供 b10566 預先編譯檔案

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,Llama.cpp 已釋出 0.2.0 版本。官方 GitHub 頁面已提供 v0.2.0 標籤的更新日誌與原始碼,並同步釋出 b10566 預先編譯(pre-build)版本供使用者下載。
讀原始報導

背景

llama.cpp 是一個以 C/C++ 撰寫的開源高效能推論引擎,專為執行 Llama 及相容的大型語言模型而設計。它建構於 GGML 張量函式庫之上,支援 CPU 與 GPU 混合推論,能處理超出顯示記憶體(VRAM)容量的模型。目前它已被廣泛視為幾乎所有本機端推論工具的核心標準。

這則事件的發展

  1. 2026-08-22據報 llama.cpp 提交 PR 支援多模態 MoE 模型 dots3-note,具備 280B 參數與 512K 上下文
  2. 2026-08-20llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s
  3. 2026-08-18llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%
  4. 2026-08-10社群釋出 llama.cpp 修補程式修正 MTP 記憶體高估,AMD 雙卡執行 Qwen 27B 上下文從 64K 提升至 149K

來源

本期分類
相關主題