跳到主要內容
2026-09-09 日報
開發生態

Meta 揭露 12.9 萬張 GPU 叢集建置細節:網路硬體故障率最高,並計畫 2027 推出 MTIA 450/500

INSIDE單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Meta 工程副總裁唐春強在 SEMICON Taiwan 揭露超大規模 AI 基礎設施的建置細節與硬體挑戰。Meta 於 2024 年耗時數月,藉由騰空 5 座營運中的資料中心並搬移逾 5,000 個機架,建置了 12.9 萬張 GPU 的叢集。 算力逾 1 GW 的「Prometheus」叢集預計今年底上線,未來將建設目標 5 GW 的「Hyperion」叢集。晶片方面除了混用 AMD 與 NVIDIA GPU,自研的 MTIA 400 正在量產(每機架配置 72 顆),並計畫於 2027 年推出主攻生成式 AI 推論的 MTIA 450 與 500。 在硬體維運上,Meta 目標為每 8,000 張 GPU 每天硬體故障不超過 2 次,初期實際故障率高出 100 倍,經過去 12 個月與供應商合作才壓低 50 倍。數據顯示,Scale-up 與 Scale-out 網路硬體是故障頻率最高的元件。 針對計算出錯但不報錯的靜默資料損壞(SDC,例如特定運算有 5% 機率異常回傳 0),Meta 發現每幾百張 GPU 中即有一張出現過 SDC,比例高於 CPU(每幾千顆一顆),為此已開源 CG-Bench 偵測工具。此外,機架匯流排(Busbar)螺絲鬆動曾導致功耗回報異常與韌體限電,使叢集中約 5% 的 GPU 效能低落。
讀原始報導

背景

高頻寬記憶體(HBM)是一種常與高效能圖形加速器、網路設備及特殊應用晶片(ASIC)結合使用的技術。部分處理器也會將其作為封裝快取或記憶體使用,以滿足龐大的資料傳輸需求。

來源