開發生態
華為揭露盤古模型在昇騰 950 平台的通訊最佳化實踐:MoE AllToAll 與超長上下文 TTFT 效能提升逾 10%
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
華為 2012 實驗室專家李柏潮將於 AICon 深圳大會分享盤古大模型在昇騰(Ascend)平台的訓練與推理通訊最佳化實踐。
在 MoE 模型訓練中,AllToAll 通訊佔總端到端時間 30% 以上。華為透過適配昇騰 950 的網路拓撲與 CCU 通訊加速器,在盤古模型的 EP(專家平行)通訊域 AllToAll 上實現 10% 以上的效能提升。
針對 1M 超長上下文推理場景,Host to Device (H2D) 的 KV Cache 傳輸延遲成為 TTFT 的瓶頸。昇騰 950 為每個 NPU 提供專用的 H2D 通路,並搭配 Omni Cache 軟體實現高效的 KV Cache 卸載(H2D 與 D2H 通訊),使 TTFT 提升 10% 以上。
華為指出,針對昇騰 950 進行的硬體親和最佳化是犧牲普適性以換取效能,例如 DeepEP 方案不適用於昇騰 910A3,且相同策略若套用於昇騰 910A2/A3 或 NVIDIA H20 等其他平台將會失效,甚至導致效能劣化。
讀原始報導背景
DeepEP 是一個專為機器學習訓練與推理設計的高效能通訊函式庫,主要聚焦於專家平行(Expert Parallelism)技術。它能為混合專家(MoE)模型提供高吞吐量且低延遲的 AllToAll GPU 核心通訊,並支援 FP8 等低精度運算。
來源
- AI 前線infoq.cn
- github.com