研究與評測
NVIDIA 揭露 Vera Rubin 平台細節:整合 Groq 3 LPX 與 Vera CPU 應對 Agentic AI,NVL72 每兆瓦吞吐量最高提升 30 倍
INSIDE單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,NVIDIA 配合 Hot Chips 2026 揭露 Vera Rubin 平台技術細節,指出 Agentic AI 的複雜工作負載正改變 AI 基礎設施的效能評估標準,從單純比較晶片峰值算力轉向衡量「每 MW 電力吞吐量」與「互動速度」。
在效能測試方面,NVIDIA 指出傳統 8K 至 32K token 測試已不足以反映 Agentic AI 需求,未來需處理數十萬 token 等級的輸入。在 DeepSeek V4 Pro、14 萬 token context 的 Agentic Coding 負載下,Vera Rubin NVL72 相較 GB300 NVL72,每 MW token 吞吐量差距達 2 倍、10 倍,最高可達 30 倍。
硬體分工上,官方文件顯示 Vera Rubin 與 Groq 3 LPX 採用共同設計架構,將 Rubin GPU 與 LPU 結合運作。Groq 3 LPX 鎖定極低延遲推論,目前已全面量產,在 Agentic AI 工作負載中達到每秒 2,900 個輸出 token。在 Artificial Analysis 以 Gemma 4 31B(Reasoning)進行的 10 萬 token context 測試中,Groq 3 LPX 輸出速度約每秒 3,431 token,為第二名的 4 倍。官方指出,Groq 3 LPX 系統能為兆級參數模型帶來 10 倍的營收機會,並提供高達 35 倍的每兆瓦推論吞吐量;Nebius 將成為首批在雲端採用的業者之一。
針對 AI 代理產生的大量 API 呼叫、資料整理與程式碼執行需求,SpaceX 將在生產環境中大規模部署 Vera CPU,用於下一代 Agentic AI 應用。
網路架構方面,NVIDIA 推出「Scale-In」基礎設施處理安全與資料,基於 BlueField-4、DOCA 與 Spectrum-X Ethernet,將 AI factory VPC 網路效能最高提升 18 倍,儲存網路效能提升 2 倍。負責橫向連線的「Scale-Out」則採用 Spectrum-X Multiplane 架構,由 8 個網路平面組成,單一平面故障仍可維持約 90% 總頻寬,故障恢復速度最高達軟體方案的 11 倍,AI Factory Goodput 提升約 1.6 倍。該雙層網路最多可擴展至 51.2 萬顆 Rubin GPU,CoreWeave 正於生產環境部署此架構以連接 Vera Rubin 機架。
讀原始報導背景
NVIDIA 的 Vera Rubin 平台專為低延遲與大上下文的代理式 AI(Agentic AI)系統所設計。該平台透過共同設計的架構結合 Rubin GPU 與 LPU,並引入 Groq 3 LPX 推論加速器,以應對兆級參數模型的龐大運算需求。