跳到主要內容
2026-08-07 日報
前瞻與傳聞

據報 Kimi K3 達 2.8 兆參數:配置 896 個路由專家,採 LatentMoE 與 KDA 混合注意力架構

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Kimi 研究員蘇劍林發布的文章披露,Kimi K3 模型總參數達 2.8 兆,配置 896 個路由專家,每個 Token 僅激活其中 16 個。為解決大規模 MoE 的跨設備通訊瓶頸,K3 採用 LatentMoE 架構,將 7168 維的主隱藏維度壓縮至 3584 維空間供路由專家計算,完成後再升維,並保留 2 個共享專家處理通用計算。 針對降維路徑的數值波動與負載問題,K3 引入 Stable LatentMoE 機制:以 RMSNorm 校準專家分支尺度,透過 SiTU-GLU 的 Soft Cap 限制極端值以保護 BF16 與 FP8 低精度訓練,並改用 Quantile Balancing 直接求解分布來協調 896 個專家的負載均衡。 在注意力架構上,K3 大致以每 3 層 KDA 插入 1 層 MLA 的比例交替排列。KDA 負責以較低成本維持連續狀態,MLA 則執行全局回查;由於 KDA 的遞迴更新已部分包含位置資訊,K3 在 MLA 中移除了 RoPE,但為相容現有 Attention Kernel 與 KV Cache 佈局,仍保留原用於 RoPE 的 64 維分支(NoPE MLA),並在 MLA 輸出後增加 Gate 來篩選回查結果。此外,K3 沿用 Muon 最佳化器,但採用 Per-Head Muon 依 Attention Head 分開處理參數,以減少不同 Head 間的耦合。
讀原始報導

背景

混合專家模型(MoE)在擴展參數規模時,常面臨跨設備通訊與計算成本的瓶頸。LatentMoE 是一種改良的 MoE 架構,主要透過縮減專家計算時的有效維度來降低路由路徑成本。這項技術能在維持模型表達能力的同時,提升每個參數與浮點運算(FLOP)的準確度。

這則事件的發展

  1. 2026-08-04AirLLM 支援 Kimi K3 2.8T,單張 RTX 6000 Ada 僅用 3.72GB VRAM 推論
  2. 2026-08-03Wafer 稱 8× AMD MI355X 跑 Kimi K3 達 952 tok/s,每美元效能勝 B300
  3. 2026-08-01據報 Coinbase、Airbnb 轉用中國大模型降成本,Kimi K3 具 2.8 萬億參數並支援 100 萬 to
  4. 2026-07-29Kimi K3開放權重,部署門檻高
  5. 2026-07-29Kimi K3架構解析

來源

本期分類