跳到主要內容
2026-07-29 日報
模型發布

Kimi K3架構解析

Hacker News未證實
據單一來源文章整理,昨日發布的開放權重模型 Kimi K3 據稱規模達 2.8T,並具備原生多模態能力。其架構延續 Kimi Linear,導入 LatentMoE、全面採用 NoPE,並以注意力殘差改善跨層連結。報告稱注意力殘差可小幅提升驗證損失與下游效能,但會增加約 4% 訓練成本與 2% 推論成本;官方細節尚待進一步佐證。
讀原始報導

背景

Kimi Linear 是一種高效率注意力架構,核心的 Kimi Delta Attention(KDA)透過更細粒度的閘控機制,更有效運用有限狀態 RNN 的記憶體。LatentMoE 則是改良的 Mixture-of-Experts(MoE)架構,旨在緩解標準 MoE 在低延遲情境下的記憶體頻寬瓶頸,並提升每單位運算量與參數所能達到的準確度。

社群討論

整體對 Kimi K3 的 KDA、NoPE、Latent MoE 等架構創新多有肯定,部分實測認為表現可比 Opus 4.7/4.8,尤其擅長前端與網站動態設計;也有留言補充 KDA 類似可平行訓練的 RNN,其狀態更新可能承擔位置資訊。主要質疑集中在線性注意力可能有損、文件能否完整重現、Cursor 用量成本偏高,以及近期實作品質不穩:有人遇到工具呼叫失敗與無止境思考,K2.6 解題超過 10 分鐘仍無進展,DeepSeek V4 卻在 1 分鐘內完成;另有人提醒,架構創新並不能否定蒸餾攻擊是否發生。

這則事件的發展

  1. 2026-07-28Kimi K3開放權重並登榜首
  2. 2026-07-28月之暗面釋出Kimi K3權重
  3. 2026-07-28Kimi K3傳首日支援vLLM
  4. 2026-07-28Kimi K3挑戰封閉模型策略
  5. 2026-07-25英美機構初評 Kimi K3 網攻能力

來源