跳到主要內容
2026-08-03 日報
研究與評測

Wafer 稱 8× AMD MI355X 跑 Kimi K3 達 952 tok/s,每美元效能勝 B300

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Wafer 單一來源測試,8× AMD MI355X 以 TP8 部署 Kimi K3,在 1,024-token 輸入、400-token 輸出設定下,峰值總吞吐量達 952 tok/s、單串流解碼達 118 tok/s;這項結果目前尚無其他來源獨立佐證。 Kimi K3 擁有 2.8T 參數,僅權重便需超過 1.5TB VRAM,尚未計入 1M-token 上下文的 KV cache。單一 8×192GB B200 節點無法同時容納權重與 KV pool,因此 B200 測試採用兩個節點、共 16 張 GPU 的 TP16 部署;B300 與 MI355X 則各有每張 288GB VRAM,可在單一八卡節點執行。 Wafer 的測試顯示,16× B200 的單串流解碼為 90 tok/s,兩節點總吞吐量為 498 tok/s,折合每節點約 249 tok/s;MI355X 的每節點總吞吐量超過其 3.8 倍,單串流解碼則超過 1.3 倍。B300 以 TP8+DCP8 達到單串流 172 tok/s、總吞吐量 1,568 tok/s,總吞吐量約為 MI355X 的 1.65 倍。 按 Wafer 採用的每 GPU 小時價格計算,MI355X 為 2.50 美元、B200 為 4.25 美元、B300 為 6.00 美元;三者峰值總吞吐量分別為每美元 48、7 與 33 tok/s。MI355X 每張 GPU 的峰值吞吐量為 119 tok/s,B200 為 31 tok/s,B300 為 196 tok/s。Wafer 因此主張,MI355X 雖然絕對吞吐量不及 B300,但價格約低 2.4 倍,每美元效能更高;相較 B200,其價格約低 1.7 倍。 B200 的數字受到跨節點 all-reduce 影響,解碼關鍵路徑使用約 195 Gb/s 的 RoCE v2;它也是三種設定中唯一跨越兩個節點的部署。Wafer 認為,Kimi K3 的模型規模讓 MI355X 的 HBM 容量相較 B200 形成可量測的部署優勢。 Kimi K3 原本沒有 MTP 或 EAGLE draft tensors,推測式解碼改用 RadixArk 的外部 block-diffusion draft 模型 Kimi-K3-DSpark。其 ROCm 路徑因 sglang 未定義 top_k_renorm_prob 而導致 scheduler 出錯,Wafer 以單一 PyTorch 函式補上 top-k renormalization,未撰寫自訂 kernel。修正後,單串流效能提高約 2.2 倍,中等負載下每串流效能提高約 1.7 倍,峰值總吞吐量增加 18%,峰值並由無推測式解碼時的 c24 移至 c64 並行度。 在 172k-token 冷啟動 prefill 測試中,MI355X 原需約 51 秒,B300 約需 23 秒。原因是 Kimi K3 在 TP8 下每個 rank 有 12 個 attention heads,但 AITER MLA prefill kernel 僅支援 4、8 或 16 倍數的 head 數,使 ROCm 回退至較慢的通用 Triton attention。Wafer 將 head 數由 12 補零至 16 後執行 AITER kernel,再取回原本 12 個 heads;AITER MLA prefill ASM 的穩態速度約為 13k tok/s,高於 Triton 的約 4k 至 7k tok/s,使 prefill 加速約 2 至 3 倍,但不改變解碼吞吐量。 Kimi 官方文件另顯示,Kimi K3 採用 KDA 混合線性注意力機制(Kimi Delta Attention)與 Attention Residuals,並原生支援視覺理解。
讀原始報導

背景

Kimi K3 是一款擁有 2.8 兆參數、100 萬 token 上下文視窗,並原生支援視覺理解的模型。其架構採用 KDA 混合線性注意力機制(Kimi Delta Attention)與注意力殘差(Attention Residuals),龐大的模型與上下文需求也使 GPU 記憶體容量成為部署時的重要條件。

社群討論

整體風向強烈質疑這是 Wafer/AMD 的廣告式、不公平且難以重現的比較:B300 單串流快約 46%、總吞吐快約 65%,MI355X 只在採用特定租賃價(每 GPU 小時約 US$2.50~2.95,對比 B300 的 US$6)計算效能價格比時勝出,但留言認為這未納入功耗、實際 TCO,且缺少程式碼、ROCm 經修改。另有補充指出 B200 因跨節點 RoCE v2 約 195 Gb/s 的 all-reduce 而吃虧;Wafer 員工則回應部署至 OpenRouter 前已通過準確度、連貫性、推理與工具呼叫測試。討論也延伸至 Kimi K3 應稱「open source」或「open weights」,雙方對是否必須公開訓練資料與工具沒有共識。

這則事件的發展

  1. 2026-08-01據報 Coinbase、Airbnb 轉用中國大模型降成本,Kimi K3 具 2.8 萬億參數並支援 100 萬 to
  2. 2026-07-29Kimi K3開放權重,部署門檻高
  3. 2026-07-29Kimi K3架構解析
  4. 2026-07-28月之暗面釋出Kimi K3權重
  5. 2026-07-28Kimi K3開放權重並登榜首

來源