跳到主要內容
2026-08-14 日報
開發生態

Prime Intellect 發布 Blackwell 最佳化 CUDA 核心 Prime Flash MoE,推理速度較 PyTorch 提升達 2.4 倍

X @PrimeIntellect單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Prime Intellect 發布專為 NVIDIA Blackwell 架構最佳化的 CUDA 核心 Prime Flash MoE,用於加速混合專家(MoE)模型的推理。該核心透過避免中間張量具現化(materializing),並在融合配置下省略啟動值(activation)的具現化,大幅節省記憶體流量。 效能方面,Prime Flash MoE 的速度比 PyTorch 分組 GEMM(grouped GEMM)快達 2.4 倍,並在 4k 至 128k token 範圍內提供約 2.3 倍的加速。該核心目前已整合至 prime-rl 框架中,用於加速 MoE 模型的前向傳播。 系統提供 BF16 與 MXFP8 兩種資料路徑,並具備兩種管線模式:融合(Fused)模式將三個操作合併為單一核心啟動;拆分(Split)模式則分為收集(gather)、向上投影(up projection)與向下投影(down projection)三個獨立核心。在小規模問題中,融合模式利用快取常駐的輸出累加器,使歸約(reductions)運算成本低於啟動值往返記憶體的成本。 為解決 SwiGLU 啟動函數帶來的跨 CTA(協同執行緒陣列)依賴問題,開發團隊利用 TMA(Tensor Memory Accelerator)張量映射技術,在硬體層面交錯排列 gate 與 up 投影,使單一 CTA 能同時獲取兩個運算元,消除跨 CTA 的資料交換需求。
讀原始報導

背景

MXFP8 是一種專為 Blackwell 架構 GPU(SM 10.0+)提供硬體加速的微縮放資料格式,透過每 32 個連續數值共用一個縮放因子來提升量化精度。而 SwiGLU 則是神經網路中用於控制活化與梯度訊號流動的門控機制。

來源