開發生態
NVIDIA 發布 CUDA Toolkit 13.4:新增 Windows on Arm 支援,並提供下一代 Rubin 架構預覽
NVIDIA Developer一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

NVIDIA 發布 CUDA Toolkit 13.4,正式將 Arm 平台的支援從 Linux 延伸至 Windows on Arm。
該版本首度提供下一代 Rubin GPU 架構(運算能力 107)的開發者預覽;據官方資料補充,Rubin 具備 224 個串流多處理器(SM)並採用 HBM4 記憶體。
新增的 Multi-Process Service (MPS) V3 導入現代化控制層,提供可編寫腳本的 CLI、命名空間與 TOML 設定支援,並加入 SM 分割控制與整合 cgroup 的 GPU 記憶體限制,實現精確的硬體資源隔離。
針對大規模多 GPU 系統,CUDA Compute Fabric Transport (CFT) 提供以傳輸為中心的 NVLink 資料移動方式,支援單播與多播通訊,以降低虛擬位址壓力。
開發者現在可透過程式化存取「局部性網域(Locality domains)」,將運算與記憶體分配在同一網域以提升效能;同時新增統一記憶體常駐位置查詢 API(`cudaMemGetLocationInfo`),避免無效的頁面遷移。
系統配置方面,CUDA SDK 安裝檔不再綑綁 NVIDIA 驅動程式,需分開安裝;在 Grace Hopper 等硬體一致性平台上,驅動程式預設改用 CDMM(Coherent Driver-based Memory Management)而非 NUMA。
此外,主機編譯器相容性擴展至 GCC 16 與 Clang 22,CUDA Python 的 `cuda.core` 1.1.0 則新增紋理與表面記憶體的 Python API 支援。
讀原始報導背景
CUDA 的多行程服務(MPS)是一種輕量級的執行階段服務,旨在讓多個應用程式能透明地協同共用 NVIDIA GPU 資源。此外,本次更新加入預覽支援的下一代 Rubin GPU 架構,則是專為代理式 AI(agentic AI)工作負載所設計。