跳到主要內容
2026-09-19 日報
開發生態

開源推理引擎 Flyweight 發布:單 GPU 結合系統 RAM 運行大型 MoE 模型,支援動態記憶體分配

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,開發者開源發布 C++/CUDA 推理引擎 Flyweight(Apache-2.0 授權),專注於在單一消費級 GPU 與系統 RAM 上運行超出 VRAM 容量的大型 MoE 模型。該引擎會在啟動時自動計算記憶體分配,將無法放入 VRAM 的專家模型(experts)交由 CPU 運行,或在 GPU 上快取熱點,免去手動設定卸載層數的步驟。 Flyweight 提供原生 GGUF 推理,相容 OpenAI/Anthropic API 並內建 Chat UI。目前支援 Qwen 3.x(含 Qwen3.8-Flash-Next)、DeepSeek-V4-Flash、Gemma 4 等模型,同時支援 Qwen 的 mmproj 圖像輸入,以及與對話模型同卡運行的 Z-Image-Turbo 圖像生成。 開發者在配備 5070 Ti 12GB VRAM 與 60GB RAM 的筆電上實測:Qwen3.8-Flash-Next IQ1_S 解碼約 35 tok/s、預填充約 475 tok/s;DeepSeek-V4-Flash 約 6-7 tok/s(達 DRAM 頻寬極限);在旁載入 35B 模型的情況下,生成 1024x1024 圖像約需 15 秒。 在技術實作上,其 Kernel 透過 NVRTC 在執行期編譯,安裝包內無需 CUDA toolkit;KV cache 支援 f16、q8_0 與 TurboQuant 4-bit。針對代理應用,工具呼叫會透過 sampler grammar 強制執行,並在呼叫期間限制溫度與懲罰參數,以提升 Claude Code 等工具在小量化模型上的穩定性;同時設有思考預算(Thinking budget)硬性上限與 `stop_thinking` 端點。 目前專案提供 Linux x86-64 與 Windows 版本,開發者正徵求針對其他硬體(如 macOS/ARM、AMD CPU、8GB 顯卡)的測試,以及 1-3 bit IQ 格式 CPU 專家模型 Kernel 的社群貢獻。
讀原始報導
本期分類