跳到主要內容
2026-09-18 日報
開發生態

華為發布 Ascend 960 與 SuperPoD 超級節點:效能翻倍,首導 NPO 光互連支援 4,000 顆處理器

DigiTimes綜合 3 家報導多家報導
已查原文 · 7 項主張

多個報導來源提及此事;未必是彼此獨立的證據。

原報導來源因付費牆無法完整讀取,但透過查閱其他科技媒體的報導,足以證實文章中的各項主張。華為在全聯接大會 2026 發表了 Ascend 960 晶片、SuperPoD 超級節點,並連帶推出 Hi-ONE NPO 光互連與 OceanStor M900 等設施;且該晶片效能翻倍並提前三季上市。此外,針對模型訓練通訊瓶頸的架構設計理念,以及部署 256K 節點系統等細節皆獲得其他報導印證。

華為在全聯接大會 2026 發布次世代 Ascend 960 晶片與 SuperPoD 超級節點

已讀原文與其他報導來源證實,華為在全聯接大會上公布了昇騰 960 晶片與超級節點。

昇腾 960 芯片、昇腾 960 超节点

查看原始出處

華為同步推出 Hi-ONE NPO 光互連、鯤鵬超級節點及 OceanStor M900 等基礎設施

報導中的基礎設施發布名單與來源完全吻合。

Hi-ONE NPO 光互联

查看原始出處

輪值董事長汪濤表示,Ascend 960 晶片效能較前代提升一倍,進度超出預期,目標上市時間已提前三個季度

來源指出汪濤確認了效能翻倍與上市時間提前三個季度的消息。

上市時間已提前三個季度

查看原始出處

華為即將開始量產全球首款整合光源的近封裝光學(NPO)產品

來源一致證實華為推出業界首個量產且內置光源的 NPO 產品。

首款整合光源的 NPO 產品

查看原始出處

新一代 SuperPoD 首度導入 NPO 架構,搭配 UnifiedBus 與 Hi-ONE,使單一超級節點可連接多達 4,000 顆處理器

來源證實 SuperPoD 架構首度導入 NPO,且單節點連接處理器數量達 4,000 顆以上。

連接多達 4,000 顆處理器

查看原始出處

十萬卡叢集已成訓練十萬億級 MoE 模型的標配,但在傳統 8 卡伺服器架構下,晶片間通訊開銷恐占總訓練時間逾 40%,嚴重限制模型浮點算力利用率(MFU),超級節點即是為縮短通訊距離而設計

來源證實了通訊開銷占 40% 影響 MFU,及超級節點的設計目的。

通信开销可能超过全部训练时间的 40%

查看原始出處

華為研究員 Liao Heng 於 arXiv 發布論文指出,華為已部署一套 256K 節點級單一 AI 運算系統,透過 UnifiedBus 與 Nested BP 運作如單一機器

來源證實了 Liao Heng 論文中關於部署 256K 節點運算系統及互連技術的說法。

已部署一套 256K 節點級的單一 AI 運算系統

查看原始出處
華為在全聯接大會 2026 發布次世代 Ascend 960 晶片與 SuperPoD 超級節點,並同步推出 Hi-ONE NPO 光互連、鯤鵬超級節點及 OceanStor M900 等基礎設施。輪值董事長汪濤表示,Ascend 960 晶片效能較前代提升一倍,進度超出預期,目標上市時間已提前三個季度;華為也即將開始量產全球首款整合光源的近封裝光學(NPO)產品。 新一代 SuperPoD 首度導入 NPO 架構,搭配升級版 UnifiedBus(靈衢)互連技術與 Hi-ONE 光學系統,使單一超級節點可連接多達 4,000 顆處理器,讓高速光學連接進一步深入運算系統內部。華為指出,十萬卡叢集已成訓練十萬億級 MoE 模型的標配,但在傳統 8 卡伺服器架構下,晶片間通訊開銷恐占總訓練時間逾 40%,嚴重限制模型浮點算力利用率(MFU),超級節點架構即是為縮短運算元件間的通訊距離而設計。 此外,華為試圖透過高效率的堆疊與互連技術彌補先進製程的限制。據華為研究員 Liao Heng 同日在 arXiv 發布的論文指出,華為目前已部署一套 256K 節點級的單一 AI 運算系統,規模遠超單一 SuperPoD,該系統透過 UnifiedBus 與華為 Nested BP 運算模型貫穿,使其能像單一機器般運作。
讀原始報導

來源