跳到主要內容
2026-10-05 日報
模型發布

開源專案 Strata 支援在消費級顯卡部署 125B 模型 Qwen3.8-Flash-Next,RTX 3090 生成可達 100-140 tokens/s

Hacker News單一來源
已查原文 · 9 項主張

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

報導中關於開源專案 Strata 部署 Qwen3.8-Flash-Next 125B 模型的各項宣告,包含硬體最低需求、多款顯示卡(RTX 5070、RX 9070 XT 及 RTX 3090)的效能實測、多種模型版本(Coder、Swift 1.5)與 MCP 安裝方式等,皆與 GitHub 原始說明完全相符;正式版支援百萬上下文亦獲官方資料支持。全部主張均被證實。

Strata支援在Windows與Linux系統的消費級硬體上本地部署125B參數的大型模型Qwen3.8-Flash-Next。

原文明確指出該專案能在一般PC環境運行此模型。

runs Qwen3.8-Flash-Next

查看原始出處

最低硬體需求為12GB VRAM的NVIDIA或AMD顯卡、32GB記憶體、80GB儲存空間,支援多GPU共享。

原文記載的最低顯存要求與報導數據吻合,並在其他段落證實記憶體與硬碟要求。

12 GB of VRAM

查看原始出處

RTX 5070 (12GB) 搭配64GB記憶體運行Q2_0版本,生成速度達94 tokens/s,讀取速度2,650 tokens/s。

原文實測表格列出 RTX 5070 的生成效能確實為 94 tokens/s。

RTX 5070

查看原始出處

94 tokens/s

查看原始出處

RX 9070 XT (16GB) 搭配47GB記憶體運行Q2_0版本,生成速度60 tokens/s,讀取速度1,160 tokens/s。

實測表格中亦包含 RX 9070 XT 的數據,且與報導完全相同。

RX 9070 XT

查看原始出處

使用具備24GB VRAM的RTX 3090,預估生成速度可達100至140 tokens/s。

原文的確預估 RTX 3090 具備此生成速度區間。

100-140 tokens

查看原始出處

專案提供多種尺寸與版本,包含Q2_0、IQ2_XS、IQ3_XXS、IQ3_S、Swift 1.5微調版及Unsloth 4-bit版。

除了表格列出的量化尺寸外,原文也特別介紹了 Swift 1.5 等版本。

Swift 1.5

查看原始出處

Coder版本移除半數專家模型,32GB記憶體環境可運行,SWE-bench Verified達完整模型的91%效能,但中文等非程式碼任務較弱。

原文解說 Coder 版的特性,確認其精簡了專家模型並犧牲了部分中文處理能力。

experts removed

查看原始出處

安裝支援批次檔/腳本,並支援透過MCP伺服器利用Claude Code、Cursor等AI工具自動檢測並完成安裝啟停。

原文指引中包含了自動化腳本以及結合 MCP 伺服器的 AI 工具安裝方式。

MCP server

查看原始出處

基於Qwen3.8-Flash-Next的正式版Qwen3.8-Flash預設支援高達100萬token的上下文長度。

Qwen 官方說明證實正式版的預設上下文長度。

1M context length

查看原始出處
開源專案 Strata 釋出,支援在 Windows 與 Linux 系統的消費級硬體上,本地部署 125B 參數的大型模型 Qwen3.8-Flash-Next。 硬體最低需求為配備 12GB VRAM 的 NVIDIA 或 AMD 顯示卡、32GB 記憶體與 80GB 儲存空間,並支援多 GPU 共享模型。在實測效能上,使用 RTX 5070(12GB)搭配 64GB 記憶體運行 Q2_0 量化版本,生成速度達 94 tokens/s,讀取速度為 2,650 tokens/s;RX 9070 XT(16GB)搭配 47GB 記憶體運行同版本,生成速度為 60 tokens/s,讀取速度為 1,160 tokens/s;若使用具備 24GB VRAM 的 RTX 3090,預估生成速度可達 100 至 140 tokens/s。 專案提供多種模型尺寸,包含 Q2_0、IQ2_XS、IQ3_XXS、IQ3_S 等。其中 Coder 版本移除了半數專家模型,可於 32GB 記憶體環境運行,在 SWE-bench Verified 測試中達到完整模型的 91% 效能,但處理中文等非程式碼任務表現較弱;另有縮短思考時間的 Swift 1.5 微調版,以及 Unsloth 提供的 4-bit 版本。 安裝方式除了提供批次檔與腳本,也支援透過 Claude Code、Cursor、GitHub Copilot 等 AI 開發工具,利用其 MCP 伺服器自動檢測硬體並完成安裝與啟停。此外,根據官方資料補充,基於 Qwen3.8-Flash-Next 的正式版 Qwen3.8-Flash 預設支援高達 100 萬 token 的上下文長度。
讀原始報導

背景

Qwen3.8-Flash-Next 為官方 Qwen3.8-Flash 模型的基礎版本。正式版的 Qwen3.8-Flash 針對生產環境加入了更多功能,包含官方內建工具等擴充應用。

社群討論

社群讚賞此專案在消費級硬體上的驚人速度,實測 RTX 4090 可達 110-124 tok/s,RTX 6000 Pro 解碼更達 255 tok/s。然而,多數人強烈質疑極端量化(低至 2-bit)與閹割 MoE 專家會嚴重犧牲推理準確度與併發處理能力,實測顯示 Strata 的視覺誤差(中位數 154.8 像素)遠遜於 llama.cpp(46.5 像素)。許多開發者認為,與其追求低量化的 125B 模型,高量化的 27B 模型在長文本程式碼任務上可能更為實用。

來源