模型發布
Cerebras 上線 Qwen 3.8 27B 模型,據報推論速度達 1500 tokens/s
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Hacker News 消息指出,Qwen 3.8 27B 模型已在 Cerebras 平台上線,推論速度據報高達 1500 tokens/s。
根據 Cerebras 官方推論文件說明,平台公共端點所託管的開源模型皆為未經剪枝(unpruned)的原始版本。為確保輸出品質,Cerebras 僅在儲存階段採用選擇性權重量化(支援 16-bit、8-bit 與 4-bit),敏感層則保留全精度並在運算時即時反量化(dequantization)。同時,模型的激活值(activations)、注意力機制(attention)與 KV 快取在運作時均維持全精度且不進行量化。
官方亦澄清,其研發的 REAP(Router-weighted Expert Activation Pruning)剪枝模型僅於 Hugging Face 提供研究社群使用,不會透過生產環境的共用 API 提供,並承諾不會在未通知的情況下更改現有端點的模型架構。
讀原始報導社群討論
社群高度讚賞 Cerebras 極致的生成速度(實測達 890~1500 tok/s),認為能大幅節省等待時間,但嚴苛的速率限制(150k~450k TPM)與缺乏快取折扣成為致命傷,有實測指出 90 秒內即因觸發限制燒掉 $1.10 且任務未完成(對比 DeepSeek-V4-Flash 僅需 $0.024)。此外,部分開發者質疑為 27B 這種能在本地端(64GB RAM 或 RTX 5090)流暢運行的小模型付費並不划算。也有人反映其工具呼叫失敗率較高,導致整體開發效率並未因生成極快而顯著提升。