跳到主要內容
2026-08-20 日報
開發生態

Cerebras 發布 CS-4 機櫃級 AI 推論系統:搭載 3 顆 WSE-3 Turbo,號稱較 GPU 快 30 倍

Hacker News綜合 3 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Cerebras 宣布推出全新機櫃級 AI 推論系統 CS-4,預計於今年第三季上市。該系統專為 AI 推論設計,單一機櫃搭載 3 顆由台積電 5 奈米製程生產的 WSE-3 Turbo 巨型晶片。 在效能方面,Cerebras 號稱 CS-4 在「每位使用者每秒 token 數」指標上較現有 GPU 系統快達 30 倍;與前代 CS-3 相比,單一晶片速度提升 2 倍,每瓦吞吐量提升達 10 倍。針對規模超過十兆(10 trillion)參數的超大型模型,CS-4 仍能維持每秒生成超過 1,000 個 token 的速度。 硬體架構上,CS-4 首度採用 Nexus 模組化機櫃平台,其「晶圓級背包(Wafer-Scale Backpack)」設計將晶片、供電、直接液冷與高速 I/O 整合為緊湊的 3D 封裝,使整體零組件數量減少 50%,將資料中心部署時間從數天縮短至數小時。供電模組距處理器僅 0.5 公釐,比傳統 GPU 板卡近約 100 倍,幾乎消除板級功耗損失,並能為 WSE-3 Turbo 提供雙倍電力以拉高運作時脈。 此外,新一代可程式化 I/O 子系統使頻寬翻倍,並支援無交換器(switchless)的跨機櫃晶片直連,將晶片間傳輸延遲降至 2 微秒。執行長 Andrew Feldman 透露,公司計畫在 2027 年底前部署總計 600MW 的算力,屆時下一代系統的速度與吞吐量預計將分別提升 4 倍與 20 倍。
讀原始報導

背景

Cerebras 是一家專門開發人工智慧深度學習半導體與超級電腦的公司。其核心的晶圓級引擎(Wafer-Scale Engine)技術,是將多個晶粒整合在單一矽晶圓上打造出單一「超級晶片」,藉此解決記憶體頻寬、延遲與擴展性等挑戰。

社群討論

社群對 Cerebras CS-4 宣稱在 >10T 參數模型上達到 >1,000 tokens/s(比 GPU 快 30 倍)的推論速度感到驚豔,看好其能打破 Nvidia 的推論市場壟斷。但許多人質疑官方刻意隱瞞價格與功耗,且單機櫃僅 44GB * 3 的 VRAM 讓人擔憂處理長文本 KV caching 時的延遲。開發者亦抱怨其晶片仍停留在 5nm 的 WSE-3 Turbo,且平台僅提供 GLM 4.7 等過時模型,缺乏對最新開源模型的軟體支援。

來源