開發生態
YC 新創開源 Agent 推理引擎 Magnitude,主打本機自編譯核心,Metal 解碼較 llama.cpp 快 92%
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
YC S25 新創團隊推出開源 AI 代理推理引擎 Magnitude,採 Apache 2.0 授權。該引擎主打在模型執行前,於本機裝置上編譯並調校核心(kernels)以達成硬體最佳化,針對主流開放權重模型提供手動最佳化核心,而非使用預先編譯的通用版本。官方數據顯示,其解碼速度最高可達 llama.cpp 的兩倍,其中在 Apple Metal 上快 92%,在 NVIDIA CUDA 上快 19%。
記憶體管理方面,每個代理佔用的記憶體減少 27%,並會在代理停止時自動釋放;同時透過共享前綴快取(prefix caches)維持並行會話的速度。Magnitude 支援 macOS、Windows 與 Linux,相容 Apple Silicon、NVIDIA、AMD GPU 或純 CPU 環境。產品以包含 CLI 的桌面版應用程式形式提供,可一鍵連接 Pi、OpenCode、Hermes、Codex、Claude Code 與 Cline 等代理工具,並提供相容 OpenAI 的 API 供其他應用呼叫,所有提示詞與模型均於本機執行。
讀原始報導社群討論
社群肯定此推論引擎的構想,但對其「速度達 llama.cpp 兩倍」的基準測試提出質疑,指出真正的代理瓶頸在於多併發的 KV cache(如在 24GB VRAM 跑 5 個 128k context),且在 Mac 上 MLX 等引擎表現更好。實測回饋指出多 GPU 偵測 Bug 導致 llama.cpp 反而快 20-30%,且 Qwen 3.8 (Q8) 預估 12-17 tok/s 比 mtplx 慢約兩倍;開發者則回應其採用 8-bit/4-bit KV cache 量化可減少逾半記憶體,並將支援 AMD Strix Halo 與 Qwen3.8-Flash-Next。