跳到主要內容
2026-09-03 日報
模型發布

Cerebras 上線 Qwen 3.8 27B 模型,據報推論速度達 1500 tokens/s

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Hacker News 消息指出,Qwen 3.8 27B 模型已在 Cerebras 平台上線,推論速度據報高達 1500 tokens/s。 根據 Cerebras 官方推論文件說明,平台公共端點所託管的開源模型皆為未經剪枝(unpruned)的原始版本。為確保輸出品質,Cerebras 僅在儲存階段採用選擇性權重量化(支援 16-bit、8-bit 與 4-bit),敏感層則保留全精度並在運算時即時反量化(dequantization)。同時,模型的激活值(activations)、注意力機制(attention)與 KV 快取在運作時均維持全精度且不進行量化。 官方亦澄清,其研發的 REAP(Router-weighted Expert Activation Pruning)剪枝模型僅於 Hugging Face 提供研究社群使用,不會透過生產環境的共用 API 提供,並承諾不會在未通知的情況下更改現有端點的模型架構。
讀原始報導

社群討論

社群高度讚賞 Cerebras 極致的生成速度(實測達 890~1500 tok/s),認為能大幅節省等待時間,但嚴苛的速率限制(150k~450k TPM)與缺乏快取折扣成為致命傷,有實測指出 90 秒內即因觸發限制燒掉 $1.10 且任務未完成(對比 DeepSeek-V4-Flash 僅需 $0.024)。此外,部分開發者質疑為 27B 這種能在本地端(64GB RAM 或 RTX 5090)流暢運行的小模型付費並不划算。也有人反映其工具呼叫失敗率較高,導致整體開發效率並未因生成極快而顯著提升。

這則事件的發展

  1. 2026-09-02Qwen 發表 Qwen3.8-Flash-Next 125B MoE 架構:訓練 FLOPs 降至 1/9,結合 Gated DeltaNet 與稀疏注意力
  2. 2026-08-26Qwen 3.8-Flash-Next 模型即將發布,採 125B a6B 規格
  3. 2026-08-26阿里 Qwen3.8-27B 登頂 Image-to-WebDev Arena 開源榜首,輸入每百萬 token 僅 0.4 美元
  4. 2026-08-24Qwen 3.8 27B 密集模型發布,社群實測 OCR 表現超越 Gemini 3.5 Flash Lite