跳到主要內容
2026-10-01 日報
模型發布

DeepSeek 開源華為昇騰 950 全套 AI 工具鏈:TileLang 與五大核心庫上線,並聯合最佳化 128 卡超節點

The Decoder綜合 5 家報導多家報導
已查原文 · 7 項主張

多個報導來源提及此事;未必是彼此獨立的證據。

經查證,報導中的所有核心主張皆得到原文及多家科技媒體來源的支持。DeepSeek 確實針對華為昇騰平台開源了完整的 AI 工具鏈,其中包含北京大學參與研發的 TileLang 及 DeepGEMM 等五大核心函式庫。雙方聯合最佳化的超節點 UBL128 組網方案(支援 128 卡 3.2Tbps)、DeepEP 實測頻寬達 375 GB/s、以及華為後續於 CANN 社群開源的 KV Cache 池化等成果,皆與來源資料完全相符。

DeepSeek 於 9 月 30 日開源面向華為昇騰 950 NPU 的全套 AI 基礎設施組件,將原本用於 Nvidia GPU 的程式碼工具鏈完整移植。

來源證實了 DeepSeek 針對華為 AI 晶片開源程式設計工具。

releasing open-source programming tools for Huawei's AI chips

查看原始出處

高階編譯語言 TileLang 最初由北京大學研究人員開發,採用接近 Python 語法建構於 TVM 之上,透過封裝 Ascend C 底層指令簡化算子開發。

來源確認了開發起源(北京大學)、語法特性(接近 Python)、底層架構(TVM)及針對硬體的指令封裝(Ascend C)。

originally developed by researchers at Peking University

查看原始出處

接近 Python 的语法

查看原始出處

建立在 TVM 之上

查看原始出處

封装 Ascend C 底层指令

查看原始出處

同步開源五大核心運算與通訊庫:DeepGEMM、DeepEP、FlashMLA、TileKernels 與 DeepSelect。

來源中準確列出了同步開源的五大核心運算與通訊函式庫名稱,與主張一致。

DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect

查看原始出處

雙方聯合最佳化基於昇騰 950 的 128 卡超節點方案(SuperPoD Flex 與 UBL128 組網),支援 128 卡 3.2Tbps 網路。

來源明確提到聯合定義的超節點 UBL128 組網方案與 128 卡 3.2Tbps 網路交換能力。

UBL128组网

查看原始出處

128卡3.2Tbps

查看原始出處

DeepEP 通訊庫實測互連頻寬達到 Dispatch 375 GB/s 與 Combine 347 GB/s。

來源確認了實測互連頻寬資料,完全支持主張中的數據。

实测达到 Dispatch 375 GB/s

查看原始出處

DeepSeek V4 模型訓練中的多數算子已由 TileLang 承載,且在昇騰平台上皆有對應的高效能實現。

來源證實了算子在昇騰平台上皆具備對應的高效能實現。

在昇腾上均有对应的高性能实现

查看原始出處

華為隨後將低延遲推論部署、超長文本 KV Cache 池化等聯合創新成果於 CANN 社群開源。

來源證實了華為在社群開源了包括 KV cache 池化等聯合創新成果。

KVcache池化

查看原始出處
9 月 30 日,DeepSeek 正式開源面向華為昇騰(Ascend)950 NPU 的全套 AI 基礎設施組件,將原本用於 Nvidia GPU 的程式碼工具鏈完整移植,直接對標 CUDA 生態。此次發布的核心為高階編譯語言 TileLang,該語言最初由北京大學研究人員開發,採用接近 Python 的語法並建構於 TVM 之上,透過封裝 Ascend C 底層指令來簡化算子開發。同步開源的還包含與 Nvidia 平台版本一一對應的五大核心運算與通訊庫:DeepGEMM、DeepEP、FlashMLA、TileKernels 與 DeepSelect,涵蓋矩陣運算、稀疏注意力與資料篩選等功能。雙方也聯合最佳化基於昇騰 950 的 128 卡超節點方案(SuperPoD Flex 與 UBL128 組網),支援 128 卡 3.2Tbps 單層交換 Scale-up 與 256K 卡兩層交換 Scale-out 網路。數據顯示,DeepEP 通訊庫實測互連頻寬達到 Dispatch 375 GB/s 與 Combine 347 GB/s,接近硬體上限;目前 DeepSeek V4 模型訓練中的多數算子已由 TileLang 承載,且在昇騰平台上皆有對應的高效能實現。華為隨後也將大模型低延遲推論部署、超長文本 KV Cache 池化等聯合創新成果於 CANN 社群開源。
讀原始報導

來源