跳到主要內容
2026-09-30 日報
模型發布

ISTA 實驗室發布 Qwen3.8-Flash-Next 量化與剪枝版:3.5 bpw 效能持平原模型,Coder 版僅需 29.6 GB 記憶體

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,ISTA 實驗室(ISTA Deep Algorithms and Systems Lab)發布了 Qwen3.8-Flash-Next 的 GSQ 與 RCO 量化 GGUF 模型,以及移除半數專家的 Coder 剪枝版本。Qwen3.8-Flash-Next 原為 176.9B 參數的稀疏 MoE 模型(BF16 體積為 354 GB)。本次發布採用 GSQ(Gumbel-Softmax 量化)與 RCO(黎曼約束最佳化)技術,提供 2.40 至 3.50 bpw(66.4 至 83.6 GB)的四種量化版本。測試顯示,3.50 bpw(IQ3_S)版本效能持平 BF16 基準,AIME25 達 100.00,GPQA-Diamond 為 92.93(優於 BF16 的 91.92);2.40 bpw(Q2_0)版本體積僅約原版五分之一,Zero-shot 平均分數達 78.00。此外,針對程式能力的 Coder 剪枝版透過 RCO 演算法移除每層 512 個專家中的 256 個,保留權重維持 3.5 bpw,綜合等效為 1.89 bpw。該版本總大小 58.4 GB,常駐記憶體需求降至 29.6 GB,可於單張 32 GB 加速卡運行;其 SWE-bench Verified 分數為 75.60(保留 91.3% 效能),LiveCodeBench v6 為 86.28(保留 98.7% 效能)。
讀原始報導