跳到主要內容
2026-09-22 日報
開發生態

浪潮信息發布元腦 SD200 Ultra 伺服器:單機承載 2.8 兆參數 Kimi K3,Token 時延低於 5.85 毫秒

iThome 中國單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,浪潮信息在 AICC2026 大會上推出「元腦 SD200 Ultra 超節點 AI 伺服器」與「元腦 HC2000 多元算力機組」。 官方稱,SD200 Ultra 基於中國本土 AI 晶片打造,採用 3D Hyper Mesh 架構緊耦合 128 顆晶片,提供 8TB 統一編址顯存與 64TB 記憶體。系統採用原生記憶體語義通訊,通訊時延低至 0.69 微秒,並透過對稱記憶體技術實現 GPU 顯存直連,使 AllReduce 通訊時間降低 3.5 倍。 該機型單機可承載 2.8 兆參數的 Kimi K3 模型,並支援最高 10 兆參數模型單機運行。浪潮表示,其 Token 生成時延首次降至 5.85 毫秒以內(約單用戶 170 Tokens/s)。針對 Kimi K3 推論,系統透過融合 KDA、Gated MLA、MoE 等基礎算子,使算子數量降低 10 倍,推論效能提升 3 倍以上。 同日發布的 HC2000 多元算力機組採用高密液冷 AI 整機櫃與 DirectCom 2.0 架構,搭配 MCIS 推論軟體堆疊,官方稱在同等投資下可將 Token 產能提升 10 倍。
讀原始報導

背景

AllReduce 是平行程式設計中常用的集合運算(Collective operations),通常透過訊息傳遞介面(MPI)來實現。由於這類操作是互動模式的基礎,實現其高效率運作在平行運算領域備受關注。

來源