跳到主要內容
2026-09-28 日報
模型發布

新推論引擎 Inferred-Thoughts 透過 SSD 串流,在 16GB RTX 5060 Ti 運行 177B Qwen3.8-Flash-Next 達 9-10 tok/s

Reddit r/LocalLLaMA單一來源
核實資料不足

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

本次未取得足夠原文證據

據 Reddit 社群報導,開發者推出專為 MoE 模型設計的開源推論引擎 Inferred-Thoughts,成功在僅有 16GB VRAM 與 32GB RAM 的消費級硬體上運行 176.9B 參數的 Qwen3.8-Flash-Next 模型。實測使用 RTX 5060 Ti 搭配 Gen5 NVMe SSD,Decode 速度達 9.06 至 10.4 tok/s,Prefill 達 49.2 tok/s;同機器使用 llama.cpp 僅有 4.9 tok/s。 在記憶體分配上,該 119 GiB 的 NVFP4 GGUF 模型僅有 20 GiB 存放於 VRAM 與 RAM(包含密集權重與最熱門專家),其餘 99 GiB(包含 48.5 GiB 路由專家與 50.7 GiB n-gram 表)存放於 SSD。引擎透過 8 個讀取執行緒按需串流 SSD 資料,並利用 Lookahead prefetch 預測下一層專家。每生成一個 token 需從 SSD 讀取約 270 MiB,專家查找的記憶體命中率約 75%。此外,NVFP4 矩陣乘法直接在 Tensor Core 上執行,無需事先解包。 目前 v1 版本僅支援 RTX 50 系列(Blackwell 架構)、Windows 11/WSL2 及貪婪解碼(greedy decoding)。引擎內建相容 OpenAI 格式的伺服器,並支援工具呼叫。開發者預期未來 v2 版本可將 Decode 速度提升至 14-15 tok/s。長時運行會使 SSD 溫度達到 70°C,但因幾乎無寫入操作,對 SSD 壽命磨損極小。
讀原始報導

這則事件的發展

  1. 2026-09-30ISTA 實驗室發布 Qwen3.8-Flash-Next 量化與剪枝版:3.5 bpw 效能持平原模型,Coder 版僅需 29.6 GB 記憶體