跳到主要內容
主題

llama.cpp

16 則報導橫跨 142026-08-06
2026-09-09Reddit r/LocalLLaMA

網友實測 Qwen3.8-Flash-Next 推論引擎:262K 滿載 SGLang 首字延遲 35 秒,較 llama.cpp 快 7.3 倍

2026-09-05Reddit r/LocalLLaMA

開發者推出三元模型專用 GGUF 格式 Q2_B3,透過 Base-3 打包無損降低 22% VRAM 佔用

2026-09-02Reddit r/LocalLLaMA

獨立架構新模型 Spark-X2.5 4B/1.7B 現身,號稱支援 1M 上下文

2026-08-31Reddit r/LocalLLaMA

llama.cpp 提交 NUMA 鏡像權重 PR,以雙倍記憶體換取雙路 CPU 解碼效能最高提升 137%

2026-08-31Reddit r/LocalLLaMA

社群開發者釋出 Mac 最佳化版 Qwen3.8-Flash-Next,M1 Max 實測 Prefill 達 190 tps

2026-08-29Reddit r/LocalLLaMA

開發者審計 443 個 GGUF 模型:64 個實際精度與檔名不符,llama.cpp 靜默替換導致 IQ2 膨脹至 4.5 bpw

2026-08-29Reddit r/LocalLLaMA

據報 AMD 發布 ROCm 10.0,距前版 7.14 僅一個月,llama.cpp 已提交支援 PR

2026-08-22Reddit r/LocalLLaMA

據報 llama.cpp 提交 PR 支援多模態 MoE 模型 dots3-note,具備 280B 參數與 512K 上下文

2026-08-20Reddit r/LocalLLaMA

llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s

2026-08-19Reddit r/LocalLLaMA

據報 DFlash 2 發布,支援 Qwen 3.8 27B 與 Muse Glimmer

2026-08-18Reddit r/LocalLLaMA

llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%

2026-08-12Reddit r/LocalLLaMA

社群實測 DeepSeek V4 量化:揭露預設轉換 Bug,llama.cpp 在 RTX 5090 與 H100 產生不同困惑度

2026-08-11Reddit r/LocalLLaMA

Google 釋出 DiffusionGemma 技術報告,模型包含 26B A4B MoE 架構版本

2026-08-10Reddit r/LocalLLaMA

社群釋出 llama.cpp 修補程式修正 MTP 記憶體高估,AMD 雙卡執行 Qwen 27B 上下文從 64K 提升至 149K

2026-08-08Reddit r/LocalLLaMA

llama.cpp 提交新 PR 最佳化 x86 CPU,Q2_0 推論速度提升達 3.6 倍

2026-08-06Reddit r/LocalLLaMA

Qwen3-TTS 語音複製功能合併至 llama.cpp 主線,支援 1.7B Base 模型與 10 種語言