前瞻與傳聞
據報 Kimi K3 達 2.8 兆參數:配置 896 個路由專家,採 LatentMoE 與 KDA 混合注意力架構
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Kimi 研究員蘇劍林發布的文章披露,Kimi K3 模型總參數達 2.8 兆,配置 896 個路由專家,每個 Token 僅激活其中 16 個。為解決大規模 MoE 的跨設備通訊瓶頸,K3 採用 LatentMoE 架構,將 7168 維的主隱藏維度壓縮至 3584 維空間供路由專家計算,完成後再升維,並保留 2 個共享專家處理通用計算。
針對降維路徑的數值波動與負載問題,K3 引入 Stable LatentMoE 機制:以 RMSNorm 校準專家分支尺度,透過 SiTU-GLU 的 Soft Cap 限制極端值以保護 BF16 與 FP8 低精度訓練,並改用 Quantile Balancing 直接求解分布來協調 896 個專家的負載均衡。
在注意力架構上,K3 大致以每 3 層 KDA 插入 1 層 MLA 的比例交替排列。KDA 負責以較低成本維持連續狀態,MLA 則執行全局回查;由於 KDA 的遞迴更新已部分包含位置資訊,K3 在 MLA 中移除了 RoPE,但為相容現有 Attention Kernel 與 KV Cache 佈局,仍保留原用於 RoPE 的 64 維分支(NoPE MLA),並在 MLA 輸出後增加 Gate 來篩選回查結果。此外,K3 沿用 Muon 最佳化器,但採用 Per-Head Muon 依 Attention Head 分開處理參數,以減少不同 Head 間的耦合。
讀原始報導背景
混合專家模型(MoE)在擴展參數規模時,常面臨跨設備通訊與計算成本的瓶頸。LatentMoE 是一種改良的 MoE 架構,主要透過縮減專家計算時的有效維度來降低路由路徑成本。這項技術能在維持模型表達能力的同時,提升每個參數與浮點運算(FLOP)的準確度。