llama-halo-hybrid
25 則報導橫跨 19 期2026-08-06 起
2026-10-01Reddit r/LocalLLaMA
社群發布全新開源推理引擎:支援設備端自動編譯核心,號稱比 llama.cpp 快 2 倍
2026-10-01Reddit r/LocalLLaMA
網友開源 llama-halo-hybrid 專案:結合 Strix Halo 與 R9700 混合推論,解碼達 60 tok/s 並支援 256k 上下文
2026-10-01Hacker News
YC 新創開源 Agent 推理引擎 Magnitude,主打本機自編譯核心,Metal 解碼較 llama.cpp 快 92%
2026-09-28Reddit r/LocalLLaMA
Reddit 網友宣稱 llama.cpp 的 Prompt Lookup Drafting 效能提升 42 倍
2026-09-27Hacker News
據報開發者最佳化 llama.cpp 的 prompt lookup decoding,草稿生成速度最高提升 140 倍
2026-09-23Reddit r/LocalLLaMA
K2-Horizon 系列模型 GGUF 量化版釋出,需搭配分支版 llama.cpp 運行
2026-09-23Reddit r/LocalLLaMA
開源工具 Dynamic Quantiser 釋出:無須校準資料即可自訂 GGUF 動態量化,精準度優於標準 K 量化
2026-09-23HuggingFace Blog
Hugging Face Transformers 原生支援 llama.cpp GGUF 量化模型,初期專注 Apple Silicon 部署
2026-09-19Reddit r/LocalLLaMA
開發者釋出 llama.cpp 分支,透過專家串流讓 64GB Mac 以 27 tok/s 運行 95.5GB Qwen3.8-Flash-Next
2026-09-09Reddit r/LocalLLaMA
網友實測 Qwen3.8-Flash-Next 推論引擎:262K 滿載 SGLang 首字延遲 35 秒,較 llama.cpp 快 7.3 倍
2026-09-05Reddit r/LocalLLaMA
開發者推出三元模型專用 GGUF 格式 Q2_B3,透過 Base-3 打包無損降低 22% VRAM 佔用
2026-09-02Reddit r/LocalLLaMA
獨立架構新模型 Spark-X2.5 4B/1.7B 現身,號稱支援 1M 上下文
2026-08-31Reddit r/LocalLLaMA
llama.cpp 提交 NUMA 鏡像權重 PR,以雙倍記憶體換取雙路 CPU 解碼效能最高提升 137%
2026-08-31Reddit r/LocalLLaMA
社群開發者釋出 Mac 最佳化版 Qwen3.8-Flash-Next,M1 Max 實測 Prefill 達 190 tps
2026-08-29Reddit r/LocalLLaMA
開發者審計 443 個 GGUF 模型:64 個實際精度與檔名不符,llama.cpp 靜默替換導致 IQ2 膨脹至 4.5 bpw
2026-08-29Reddit r/LocalLLaMA
據報 AMD 發布 ROCm 10.0,距前版 7.14 僅一個月,llama.cpp 已提交支援 PR
2026-08-22Reddit r/LocalLLaMA
據報 llama.cpp 提交 PR 支援多模態 MoE 模型 dots3-note,具備 280B 參數與 512K 上下文
2026-08-20Reddit r/LocalLLaMA
llama.cpp 引入 DFlash2 投機解碼,Qwen 3.8 27B 本地推論速度最高提升 3 倍達 140 tok/s
2026-08-19Reddit r/LocalLLaMA
據報 DFlash 2 發布,支援 Qwen 3.8 27B 與 Muse Glimmer
2026-08-18Reddit r/LocalLLaMA
llama.cpp 提交自適應 MTP 模式 PR,動態調整預測深度使程式碼回溯最高提速 100%
2026-08-12Reddit r/LocalLLaMA
社群實測 DeepSeek V4 量化:揭露預設轉換 Bug,llama.cpp 在 RTX 5090 與 H100 產生不同困惑度
2026-08-11Reddit r/LocalLLaMA
Google 釋出 DiffusionGemma 技術報告,模型包含 26B A4B MoE 架構版本
2026-08-10Reddit r/LocalLLaMA
社群釋出 llama.cpp 修補程式修正 MTP 記憶體高估,AMD 雙卡執行 Qwen 27B 上下文從 64K 提升至 149K
2026-08-08Reddit r/LocalLLaMA
llama.cpp 提交新 PR 最佳化 x86 CPU,Q2_0 推論速度提升達 3.6 倍
2026-08-06Reddit r/LocalLLaMA