研究與評測
NVIDIA Transformer Engine 加速 JAX Dropless MoE:DeepSeek-V3 訓練達 1,068 TFLOPS/GPU
NVIDIA Developer一手來源
已查原文 · 8 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證 NVIDIA Developer 原文,關於 DeepSeek-V3 在 GB200 上的基準(103 TFLOPS/GPU)與優化後提升(10.4 倍)皆吻合。此外,關於 MoE 訓練瓶頸(ragged GEMMs)、Dropless MoE 的可變 token 特性,以及 Transformer Engine 在 JAX 提供的具體最佳化技術(MXFP8、Grouped GEMM 單次呼叫、cuBLAS 等),均與官方技術文章一致,主張獲得支持。
DeepSeek-V3在NVIDIA GB200未最佳化基準為103 TFLOPS/GPU,通訊占84%
原文證實未最佳化前效能僅為 103 TFLOPS/GPU。
103 TFLOPS/GPU
查看原始出處
Grouped GEMM單次核心呼叫處理實際token數
原文指出 Grouped GEMM 可以在一次 kernel call 處理所有 matmuls。
single kernel call
查看原始出處

NVIDIA Developer 發表技術文章,說明如何以 NVIDIA Transformer Engine 搭配 JAX,加速無丟棄(dropless)Mixture of Experts(MoE)模型訓練。在 DeepSeek-V3 的 NVIDIA GB200 訓練測試中,未最佳化基準為每 GPU 103 TFLOPS,加入 JAX 與 Transformer Engine 的核心最佳化後提升至 1,068 TFLOPS,效能增加 10.4 倍;基準測試中,GPU 間通訊曾占累計核心執行時間的 84%。
文章指出,MoE 的瓶頸包括動態 token 路由、專家分派與收集、all-to-all 通訊,以及不同專家收到不同 token 數量後形成的不規則張量與 GEMM。相較於容量限制型 MoE 會固定每個專家的 token 預算、截斷溢出 token 或以填充換取規則計算,dropless MoE 會讓每個 token 都交由選定專家處理,因此需要能處理可變 token 數量的 GPU 核心。
Transformer Engine 在 JAX 中提供群組感知的 MXFP8 量化、專家矩陣乘法的 MXFP8 grouped GEMM,以及最佳化的專家平行(EP)分派與合併操作。Grouped GEMM 可在單次核心呼叫中處理所有專家的實際 token 數量,避免逐一 GEMM 造成的裝置到主機資料複製,也避免以最大容量填充後產生的額外計算;其 grouped_gemm/ragged_dot 路徑則透過 cuBLAS 與 cuBLASLt 使用 NVIDIA Tensor Core。
讀原始報導背景
混合專家(MoE)架構透過將運算分配給多個小型專家網路來提升大型 AI 模型的訓練效率,但動態分配會導致各專家接收的 token 數量不一。在 Dropless MoE 架構中,系統必須處理所有 token,這會產生不規則的張量(ragged tensors),且在無同步實作下 CPU 無法預先得知 token 數量,進而對 GPU 運算與通訊造成極大挑戰。