模型發布
Cursor 開源 MoK 重寫 MoE GPU 核心,通訊延遲降至 18μs、GB300 訓練吞吐量提升 41%
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
Cursor 開源 Mixture-of-Kittens(MoK),直接重寫 MoE 的 GPU 執行方式,將 token 調度、跨 GPU 通訊與專家計算整合進同一個 Megakernel。
針對 NVIDIA GB300 NVL72 等具備高速 NVLink 的架構,MoK 將前向 Dispatch 從傳統的 Push 改為 Pull 模式,由目標 GPU 主動讀取所需 token,省去多方發送的位址協調,使多節點通訊的 signaling 延遲從約 103 微秒降至 18 微秒。
在資源分配上,MoK 將 GPU 的 SM 劃分,分別負責通訊與專家計算,並引入固定大小的 Ring Token Buffer,讓資料在 GPU 狀態推進下直接覆寫,無需 CPU 介入分配記憶體。此外,MoK 將 MXFP8 啟動量化整合進 Dispatch、Grouped GEMM 與 SwiGLU 的資料路徑中,減少獨立量化核心與 HBM 讀寫次數。
根據實測,在 GB300 NVL72 上,MoK 的 MXFP8 前向傳播速度最高提升 2.37 倍、反向提升 1.78 倍;BF16 前向與反向最高分別提升 1.92 倍與 1.58 倍。在端到端訓練方面,於 512 張 GB300 GPU 的環境中,將原有的 DeepEP 替換為 MoK 後,單卡吞吐量從每秒 760.9 個 token 提升至 1070.2 個,增幅約 41%。
讀原始報導背景
Mixture of experts (MoE) 是一種機器學習技術,透過多個專家網路將問題空間劃分,屬於一種集成學習形式。為了解決 MoE 訓練時的通訊瓶頸,Cursor 針對 GB300 NVL72 系統,從頭打造了名為 Mixture-of-Kittens (MoK) 的訓練巨型核心(megakernel)。該技術採用「融合整個層」的設計理念,將多項運算與通訊步驟整合至單一 GPU 核心中。