NVIDIA 宣布 Groq 3 LPX 系統全面量產,專攻代理式 AI 推論
該硬體結合內建 72 顆 Rubin GPU 與 36 顆 Vera CPU 的 NVL72 系統,專注降低 AI 代理的解碼延遲。
48 則值得知道的變化
該硬體結合內建 72 顆 Rubin GPU 與 36 顆 Vera CPU 的 NVL72 系統,專注降低 AI 代理的解碼延遲。
AI 算力與記憶體頻寬成長嚴重脫鉤,GPU 封裝的 HBM 面積佔比已達 90%。為突破散熱極限,美光推出頻寬達 2,800 GB/s 的 HBM4,並著手研發混合鍵合技術。
HBM4 具備超過兩萬個矽穿孔,目前 12 層產品已量產,為解決散熱問題,SK 海力士也開發 I-HBM 技術降低局部熱阻。
新架構將 Rubin GPU 結合 LPU 運作,Groq 3 LPX 輸出速度達每秒 3,431 token,SpaceX 將於生產環境部署。
三星於 Hot Chips 2026 提出從客製化 Base Die 到 3D 整合的發展路徑,新架構可提升 70% 能源效率,並以 HPB 技術降低逾 35% 峰值溫度。
採用三星 2 奈米製程與 11 個 5.7GHz 核心,透過 KVM 虛擬機管理程式動態切換模式,讓企業能在大型主機上直接運行 Arm 原生 Linux 軟體與 AI 框架。
第六代 NVLink 單一網域支援 72 個 XPU,未來擴充至 1152 個。資料中心可共用機櫃與散熱,在確立晶片組合前先行建置。
美銀測算該機櫃 216TB LPDDR5X 成本近 280 萬美元。因供貨僅能滿足六成需求,NVIDIA 恐將 Vera 系統容量減半。
SpaceX 目標 2028 年部署百萬顆衛星建構軌道資料中心,搭載的 Rubin GPU 推論成本降至 Blackwell 的十分之一,將用於驅動 Grok。
系統由 Xuanjie O3、O100 與 D100 三款晶片組成,其中 D100 支援高達 160GB 記憶體,O100 則標榜具備 1.22TB/s 頻寬。