跳到主要內容
2026-09-05 日報
開發生態

Meta 詳解推薦模型專用訓練晶片 MTIA 300:內建網路介面,通訊耗時較 GPU 縮減 3.9 倍

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Meta 詳細介紹首款專為訓練排序與推薦模型最佳化的自研加速器 MTIA 300。有別於大型語言模型著重浮點算力,推薦模型高達 99% 的參數為嵌入表,需頻繁執行 AllReduce 等跨晶片通訊操作。為此,MTIA 300 將網路介面移入加速器封裝內,透過兩個網路小晶片提供 12 個客製化 800 Gbps RDMA NIC,創造 1.2 TB/s 的 I/O 頻寬且無需經過 PCIe 匯流排。 為避免通訊佔用運算資源,晶片內建 16 個獨立於主運算網格的專屬訊息引擎,使大型矩陣運算與集合通訊能並行運作,算力損耗不到 0.5%,而傳統 GPU 架構在同等負載下損耗超過 20%。該硬體與 Meta 的集合通訊函式庫(HCCL)協同設計,由訊息引擎自主執行通訊指令,無需主機 CPU 介入。 在 40 個加速器部署 1,500 億參數推薦模型的實測中,單一機架內通訊頻寬最高達 940 GB/s,總通訊耗時較同等配置的 GPU 叢集減少 3.9 倍。Meta 表示目前已部署數十萬個 MTIA 加速器用於推論任務,並擴大與博通(Broadcom)合作,計畫未來兩年內推出四代後續產品,涵蓋排序、推薦及生成式 AI 工作負載。
讀原始報導

背景

Meta 為了應對特定 AI 工作負載的需求,正積極擴展其自研晶片計畫。其最新推出的 MTIA 300 是首款內建網路小晶片(NIC chiplets)與通用集合通訊卸載引擎的加速器,專為訓練排序與推薦模型而設計。此架構將網路與運算整合,旨在解決推薦模型訓練中龐大的資料通訊瓶頸,以提升擴展通訊的效率。

來源