NVIDIA 宣布 Groq 3 LPX 系統全面量產,專攻代理式 AI 推論
該硬體結合內建 72 顆 Rubin GPU 與 36 顆 Vera CPU 的 NVL72 系統,專注降低 AI 代理的解碼延遲。
48 則值得知道的變化
該硬體結合內建 72 顆 Rubin GPU 與 36 顆 Vera CPU 的 NVL72 系統,專注降低 AI 代理的解碼延遲。
新計算選項支援 GPU 與共享檔案系統,突破 microVM 的 8 小時限制,相容 CrewAI 等框架,適合長時間有狀態任務。
AI 算力與記憶體頻寬成長嚴重脫鉤,GPU 封裝的 HBM 面積佔比已達 90%。為突破散熱極限,美光推出頻寬達 2,800 GB/s 的 HBM4,並著手研發混合鍵合技術。
新架構將 Rubin GPU 結合 LPU 運作,Groq 3 LPX 輸出速度達每秒 3,431 token,SpaceX 將於生產環境部署。
據報導,FreeToken 透過頻寬自適應 CPU-GPU 執行與語義感知快取,讓消費級硬體無須極端量化即可運行前沿模型,解碼速度較 Ollama 快 3 至 4 倍。
WriteGuard 部署於 MCP 伺服器入口後方攔截請求,將操作分為四種風險等級,無須修改伺服器即可集中管理 AI 代理寫入權限,並生成脫敏稽核日誌。
採用三星 2 奈米製程與 11 個 5.7GHz 核心,透過 KVM 虛擬機管理程式動態切換模式,讓企業能在大型主機上直接運行 Arm 原生 Linux 軟體與 AI 框架。
第六代 NVLink 單一網域支援 72 個 XPU,未來擴充至 1152 個。資料中心可共用機櫃與散熱,在確立晶片組合前先行建置。
雙方將結合 HUMAIN 的資料中心基礎設施,初期聚焦網路安全與語音領域,並針對受監管產業推出聯合市場策略,確保資料在地控制。
美銀測算該機櫃 216TB LPDDR5X 成本近 280 萬美元。因供貨僅能滿足六成需求,NVIDIA 恐將 Vera 系統容量減半。
需具備 App Store 小型企業方案資格,若未來下載量超標將提供 6 個月過渡期轉至付費方案,目前尚未公布算力上限。
SpaceX 目標 2028 年部署百萬顆衛星建構軌道資料中心,搭載的 Rubin GPU 推論成本降至 Blackwell 的十分之一,將用於驅動 Grok。
系統由 Xuanjie O3、O100 與 D100 三款晶片組成,其中 D100 支援高達 160GB 記憶體,O100 則標榜具備 1.22TB/s 頻寬。
惡意 LLM 可輸出特定 token 序列觸發解析漏洞。vLLM 曾無視警告合併帶有 eval() 程式碼,多模態輸出恐擴大攻擊面。