跳到主要內容
2026-09-15 日報
研究與評測

NVIDIA Transformer Engine 加速 JAX Dropless MoE:DeepSeek-V3 訓練達 1,068 TFLOPS/GPU

NVIDIA Developer一手來源
已查原文 · 8 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經查證 NVIDIA Developer 原文,關於 DeepSeek-V3 在 GB200 上的基準(103 TFLOPS/GPU)與優化後提升(10.4 倍)皆吻合。此外,關於 MoE 訓練瓶頸(ragged GEMMs)、Dropless MoE 的可變 token 特性,以及 Transformer Engine 在 JAX 提供的具體最佳化技術(MXFP8、Grouped GEMM 單次呼叫、cuBLAS 等),均與官方技術文章一致,主張獲得支持。

NVIDIA Developer發表技術文章說明加速無丟棄(dropless)MoE模型訓練

原文標題及內容確實探討如何加速 dropless MoE 的訓練。

dropless MoE

查看原始出處

DeepSeek-V3在NVIDIA GB200未最佳化基準為103 TFLOPS/GPU,通訊占84%

原文證實未最佳化前效能僅為 103 TFLOPS/GPU。

103 TFLOPS/GPU

查看原始出處

加入最佳化後提升至1,068 TFLOPS,增加10.4倍

原文證實最佳化後達到了 10.4 倍的效能提升。

10.4x improvement

查看原始出處

MoE瓶頸包含不規則張量與GEMM

原文指出不規則的 ragged expert GEMMs 是一大瓶頸。

ragged expert GEMMs

查看原始出處

dropless MoE需處理可變token數量

原文指出 dropless MoE 需專為 variable token counts 設計。

variable token counts

查看原始出處

提供MXFP8量化與最佳化EP分派

原文確認 Transformer Engine 提供了群組感知的 MXFP8 量化等功能。

MXFP8 quantization

查看原始出處

Grouped GEMM單次核心呼叫處理實際token數

原文指出 Grouped GEMM 可以在一次 kernel call 處理所有 matmuls。

single kernel call

查看原始出處

使用cuBLAS與cuBLASLt

原文確認底層透過 cuBLAS 與 cuBLASLt 執行計算。

cuBLAS and cuBLASLt

查看原始出處
NVIDIA Developer 發表技術文章,說明如何以 NVIDIA Transformer Engine 搭配 JAX,加速無丟棄(dropless)Mixture of Experts(MoE)模型訓練。在 DeepSeek-V3 的 NVIDIA GB200 訓練測試中,未最佳化基準為每 GPU 103 TFLOPS,加入 JAX 與 Transformer Engine 的核心最佳化後提升至 1,068 TFLOPS,效能增加 10.4 倍;基準測試中,GPU 間通訊曾占累計核心執行時間的 84%。 文章指出,MoE 的瓶頸包括動態 token 路由、專家分派與收集、all-to-all 通訊,以及不同專家收到不同 token 數量後形成的不規則張量與 GEMM。相較於容量限制型 MoE 會固定每個專家的 token 預算、截斷溢出 token 或以填充換取規則計算,dropless MoE 會讓每個 token 都交由選定專家處理,因此需要能處理可變 token 數量的 GPU 核心。 Transformer Engine 在 JAX 中提供群組感知的 MXFP8 量化、專家矩陣乘法的 MXFP8 grouped GEMM,以及最佳化的專家平行(EP)分派與合併操作。Grouped GEMM 可在單次核心呼叫中處理所有專家的實際 token 數量,避免逐一 GEMM 造成的裝置到主機資料複製,也避免以最大容量填充後產生的額外計算;其 grouped_gemm/ragged_dot 路徑則透過 cuBLAS 與 cuBLASLt 使用 NVIDIA Tensor Core。
讀原始報導

背景

混合專家(MoE)架構透過將運算分配給多個小型專家網路來提升大型 AI 模型的訓練效率,但動態分配會導致各專家接收的 token 數量不一。在 Dropless MoE 架構中,系統必須處理所有 token,這會產生不規則的張量(ragged tensors),且在無同步實作下 CPU 無法預先得知 token 數量,進而對 GPU 運算與通訊造成極大挑戰。

來源