開源專案 Strata 支援在消費級顯卡部署 125B 模型 Qwen3.8-Flash-Next,RTX 3090 生成可達 100-140 tokens/s
已查原文 · 9 項主張
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
報導中關於開源專案 Strata 部署 Qwen3.8-Flash-Next 125B 模型的各項宣告,包含硬體最低需求、多款顯示卡(RTX 5070、RX 9070 XT 及 RTX 3090)的效能實測、多種模型版本(Coder、Swift 1.5)與 MCP 安裝方式等,皆與 GitHub 原始說明完全相符;正式版支援百萬上下文亦獲官方資料支持。全部主張均被證實。
Strata支援在Windows與Linux系統的消費級硬體上本地部署125B參數的大型模型Qwen3.8-Flash-Next。
原文明確指出該專案能在一般PC環境運行此模型。
runs Qwen3.8-Flash-Next
查看原始出處
最低硬體需求為12GB VRAM的NVIDIA或AMD顯卡、32GB記憶體、80GB儲存空間,支援多GPU共享。
原文記載的最低顯存要求與報導數據吻合,並在其他段落證實記憶體與硬碟要求。
12 GB of VRAM
查看原始出處
RTX 5070 (12GB) 搭配64GB記憶體運行Q2_0版本,生成速度達94 tokens/s,讀取速度2,650 tokens/s。
原文實測表格列出 RTX 5070 的生成效能確實為 94 tokens/s。
RTX 5070
查看原始出處
94 tokens/s
查看原始出處
RX 9070 XT (16GB) 搭配47GB記憶體運行Q2_0版本,生成速度60 tokens/s,讀取速度1,160 tokens/s。
實測表格中亦包含 RX 9070 XT 的數據,且與報導完全相同。
RX 9070 XT
查看原始出處
專案提供多種尺寸與版本,包含Q2_0、IQ2_XS、IQ3_XXS、IQ3_S、Swift 1.5微調版及Unsloth 4-bit版。
除了表格列出的量化尺寸外,原文也特別介紹了 Swift 1.5 等版本。
Swift 1.5
查看原始出處
Coder版本移除半數專家模型,32GB記憶體環境可運行,SWE-bench Verified達完整模型的91%效能,但中文等非程式碼任務較弱。
原文解說 Coder 版的特性,確認其精簡了專家模型並犧牲了部分中文處理能力。
experts removed
查看原始出處
安裝支援批次檔/腳本,並支援透過MCP伺服器利用Claude Code、Cursor等AI工具自動檢測並完成安裝啟停。
原文指引中包含了自動化腳本以及結合 MCP 伺服器的 AI 工具安裝方式。
MCP server
查看原始出處
基於Qwen3.8-Flash-Next的正式版Qwen3.8-Flash預設支援高達100萬token的上下文長度。
Qwen 官方說明證實正式版的預設上下文長度。
1M context length
查看原始出處
背景
Qwen3.8-Flash-Next 為官方 Qwen3.8-Flash 模型的基礎版本。正式版的 Qwen3.8-Flash 針對生產環境加入了更多功能,包含官方內建工具等擴充應用。
社群討論
社群讚賞此專案在消費級硬體上的驚人速度,實測 RTX 4090 可達 110-124 tok/s,RTX 6000 Pro 解碼更達 255 tok/s。然而,多數人強烈質疑極端量化(低至 2-bit)與閹割 MoE 專家會嚴重犧牲推理準確度與併發處理能力,實測顯示 Strata 的視覺誤差(中位數 154.8 像素)遠遜於 llama.cpp(46.5 像素)。許多開發者認為,與其追求低量化的 125B 模型,高量化的 27B 模型在長文本程式碼任務上可能更為實用。