NVIDIA Transformer Engine 加速 JAX Dropless MoE:DeepSeek-V3 訓練達 1,068 TFLOPS/GPU
NVIDIA 以群組 GEMM、MXFP8 量化與專家平行通訊最佳化,將 NVIDIA GB200 上的基準效能從 103 提升至 1,068 TFLOPS/GPU。
NVIDIA Developer一手來源
50 則值得知道的變化
NVIDIA 以群組 GEMM、MXFP8 量化與專家平行通訊最佳化,將 NVIDIA GB200 上的基準效能從 103 提升至 1,068 TFLOPS/GPU。
Anthropic 表示,Claude 撰寫 80% 程式碼,測試數量增 10 倍,迫使團隊將單一程序改為可分片架構。
該路徑穿越漏洞允許未驗證的遠端攻擊者讀取伺服器任意檔案,官方已釋出 19.1.8 等更新,呼籲自管環境企業儘速升級。
平台支援 ExecuTorch 等執行階段,經最佳化的 Qwen3-TTS 在 vivo 手機上可達 4 倍加速。Arm 同日亦提出機器人功能框架。
框架支援最佳化執行裝備與交付物,並透過昇騰算力親和技術調度 KV Cache,首 Token 延遲降 15.83%,降低迭代成本。
該公司於 2020 年自 Intel 分拆獨立,致力開發幫助 AI 晶片更有效通訊的網路技術,本輪融資由 IAG Capital 領投。
馬斯克表示對明年發射搭載 72 顆 GPU、重 1.3 噸的輝達機櫃級系統極具信心,長遠目標部署百萬個軌道運算節點。
高盛預估 1.6Tbps 光收發器出貨將於一年內超越 800Gbps;中國雖掌握過半光模組代工產能,高階雷射晶片仍仰賴海外供應。
中國科技大廠在 AI 軍備競賽中下重注,京東正建置十萬卡規模的算力,字節跳動則借資達 296 億,顯示 AI 算力投資已進入實質的買單週期。