研究與評測
NVIDIA Vera Rubin NVL72 於 MLPerf 6.1 首秀:Qwen3-VL 吞吐量達 GB300 的 3.7 倍
NVIDIA Blog一手來源
已查原文 · 1 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證 NVIDIA 官方部落格文章,報導中的各項硬體基準測試主張均能找到對應證據。包含 Vera Rubin NVL72 搭配不同軟體庫於各模型(如 Qwen3-VL、DeepSeek-R1 及 AgentX)的效能數據,硬體規格(NVFP4 精度與 NVLink)之特點,以及 GB300 NVL72 擴充性與軟體優化帶來的效能提升,皆與原文完全吻合。
報導中關於 Vera Rubin NVL72 吞吐量較 GB300 提升 (3.7倍、2.5倍、30倍)、具備 NVFP4 精度與 10倍封包率,以及 GB300 達 99% 擴展效率、影片生成能力與 1.6 倍效能提升等測試數據。
原文明確列出 Vera Rubin 帶來 3.7 倍 (Qwen3-VL)、2.5倍 (DeepSeek-R1) 與 30倍 (AgentX) 的效能提升,並採用 NVFP4 精度與 10 倍封包率。同時指出 GB300 達到 99% 擴展效率、處理 0.65 支 720p 影片,以及軟體優化帶來 1.6 倍的效能進步,各項主張均獲官方結果支持。
3.7x higher
查看原始出處
2.5x higher
查看原始出處
30x better
查看原始出處
NVFP4 precision
查看原始出處
10x higher packet
查看原始出處
99% scaling
查看原始出處
0.65 720p
查看原始出處
improved up to 1.6x
查看原始出處

NVIDIA 於 MLPerf Inference v6.1 預覽提交中首度公開 Vera Rubin NVL72 系統成績。在 Qwen3-VL 測試中(搭配 vLLM 與 NVIDIA Dynamo),其吞吐量達 GB300 NVL72 的 3.7 倍;在 DeepSeek-R1 測試中(搭配 TensorRT-LLM),吞吐量則為 GB300 NVL72 的 2.5 倍。
硬體架構方面,Vera Rubin 採用 NVFP4 精度以降低模型權重與 KV cache 的記憶體佔用,並透過具備 10 倍封包率與 3 倍低延遲的第六代 NVLink,結合解耦服務(分離 prefill 與 decode)與大規模專家平行化。在 SemiAnalysis AgentX 代理基準預覽測試中,其效能達 GB300 NVL72 的 30 倍。
前代 GB300 NVL72 則展現極高擴展性,在 DeepSeek-R1 測試中從單機架(72 顆 GPU)擴展至四機架(288 顆 GPU)時,離線場景擴展效率達 99%。在 WAN 2.2 影片生成測試中,單機架達到每秒 0.65 支 720p 影片、單支耗時 5.7 秒。此外,受惠於軟體最佳化,GB300 NVL72 在 Qwen3-VL 的 v6.1 成績較 v6.0 提升 1.6 倍。
本次 MLPerf 提交中,合作夥伴 Nebius 也提交了 Vera Rubin NVL72 的預覽成績;NVIDIA 另以 Jetson AGX Thor 執行 Qwen3.6-27B,提交了 Edge-Agentic 基準測試結果。
讀原始報導背景
MLPerf Inference 是一個基準測試套件,專門用於衡量系統在各種部署場景下執行模型的速度。NVIDIA Vera Rubin NVL72 則是基於第三代 MGX 設計的企業級機架規模 AI 平台,具備無纜線模組化與快速部署等特性。