跳到主要內容
2026-09-17 日報
研究與評測

NVIDIA TensorRT Edge-LLM 於 Jetson AGX Thor 執行 MLPerf 邊緣代理測試,跑 Qwen3.6-27B 較 llama.cpp 快 6.4 倍

NVIDIA Developer一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

NVIDIA 公布 TensorRT Edge-LLM 在 MLPerf Inference v6.1 邊緣代理(Edge Agentic)基準測試結果。在單台具備 128 GB 統一記憶體的 Jetson AGX Thor 開發者套件(MAXN 功耗模式)上執行 Qwen3.6-27B 模型,輸出吞吐量達每秒 52.33 詞元。 系統在 24 分 36 秒內完成包含 20 段對話、共 1,007 輪的效能工作負載,較使用 Q4_K_M 量化的 llama.cpp 參考基準(耗時 2 小時 37 分)快 6.4 倍。測試數據顯示,首個詞元延遲中位數為 247.12 毫秒,每輸出詞元延遲中位數為 14.68 毫秒,且 BFCL 整體準確率維持在 87.94%。 效能提升主要來自三項推論最佳化技術:首先是採用 Jetson AGX Thor 內建 Blackwell GPU 支援的 NVFP4 格式進行權重與啟動值量化(KV 快取採 FP8);其次為 KV 快取重複使用,使高達 96% 的提示詞元命中熱快取,總計 1,360 萬個提示詞元中僅需預填充約 50 萬個;最後是樹狀多詞元預測(MTP),透過設定 8 個草稿步驟與 16 節點驗證樹,讓目標模型能在單次前向傳遞中驗證多個高機率候選路徑,加速函數呼叫等可預測結構的生成。
讀原始報導