研究與評測
據報 Inferact 實測 TPU v7 跑 Kimi K3 速度超越 GB200 達 57%,開源自研 megakernel 推論核心
量子位單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據量子位報導,由 vLLM 原班人馬創立的推論新創 Inferact 釋出開源專案 tpu-megakernels,在完全相同的 vLLM 推論引擎條件下,16 塊 Google TPU v7 (Ironwood) 執行 Kimi K3 模型跑出每秒 709 個 token,比 16 塊 NVIDIA GB200 的每秒 452 個 token 快上 57%。
該測試結合了 DeepSeek 提出的 DSpark 推測解碼加速框架,平均每輪有 6 個 token 通過大模型驗證,單步解碼耗時約 8.5 毫秒。在關閉推測解碼的裸速測試中,Batch size 為 1 時,TPU 每秒 249 個 token,GB200 為 127 個;Batch size 為 8 時,TPU 達 865 個,GB200 為 636 個。此外,在 4 塊 TPU v7 執行 Qwen 3.8 27B 時,每秒達 1515 個 token,同配置 GB200 僅 695 個。Inferact 驗證指出,TPU 上的 Kimi K3 在 GPQA-Diamond 與 GSM8K 測試得分與 GPU 完全一致,無精度損失。
報導指出,GB200 的 HBM 記憶體頻寬(8000 GB/s)實際上高於 TPU v7(7380 GB/s),速度差異源於底層軟體最佳化。Inferact 繞過 TPU 預設的 XLA 編譯工具鏈,使用 Google 底層語言 Pallas 手寫「megakernel」,將 Kimi K3 的 92 層 MoE 計算邏輯整合成單一程式,消除數百個小 kernel 切換時的記憶體頻寬浪費。
此架構利用 TPU v7 每個 TensorCore 具備 64 MiB 可由軟體精確控制的 VMEM 晶片上記憶體(相較於 NVIDIA Blackwell 架構分散且由硬體自動調度的約 38 MiB),實現跨層權重預取,讓計算與資料搬運同時進行。這項改動也將編譯時間從 30 分鐘以上縮短至 90 秒內。
Inferact 於今年一月成立,已完成由 a16z 領投的 1.5 億美元種子輪募資,估值達 8 億美元。此次 TPU megakernel 為該公司與 Google Cloud 聯合工程合作的首個公開成果,旨在讓 TPU 成為 vLLM 的一流水準支援硬體。
讀原始報導背景
vLLM 是一個開源的大型語言模型推理與服務框架,最初由加州大學柏克萊分校的 Sky Computing Lab 所開發。該專案以 PagedAttention 記憶體管理技術為核心,旨在提供高吞吐量且節省記憶體的模型部署方案。