跳到主要內容
2026-08-26 日報
研究與評測

NVIDIA 發表 Groq 3 LPX,運行 Gemma 4 31B 測出 3,431 tokens/s 創 100k 上下文最快紀錄

X @ArtificialAnlys單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Artificial Analysis 透過私人展示端點實測,NVIDIA 今日發表的 Groq 3 LPX 在運行 Gemma 4 31B 模型時,達到 3,431 tokens/s 的輸出速度。這是該機構在 100k 上下文條件下,於所有公開或私人端點中測得 Gemma 4 31B 的最高紀錄。 根據官方文件,Gemma 4 採用 Dense 與 Mixture-of-Experts (MoE) 架構,共提供 E2B、E4B、12B、26B、A4B 與 31B 等多種模型尺寸。該模型具備超過 140 種語言的多語言支援能力,並支援高達 256K tokens 的上下文窗口。
讀原始報導

背景

Gemma 4 具備高達 256K tokens 的上下文長度,並提供包含 31B 在內的多種模型尺寸。NVIDIA 新推出的 Groq 3 LPX 則是 Vera Rubin NVL72 架構的延伸,專為處理龐大上下文窗口並提供極速反應而設計。

來源

本期分類