模型發布
Kimi K3架構解析
Hacker News未證實
據單一來源文章整理,昨日發布的開放權重模型 Kimi K3 據稱規模達 2.8T,並具備原生多模態能力。其架構延續 Kimi Linear,導入 LatentMoE、全面採用 NoPE,並以注意力殘差改善跨層連結。報告稱注意力殘差可小幅提升驗證損失與下游效能,但會增加約 4% 訓練成本與 2% 推論成本;官方細節尚待進一步佐證。
讀原始報導背景
Kimi Linear 是一種高效率注意力架構,核心的 Kimi Delta Attention(KDA)透過更細粒度的閘控機制,更有效運用有限狀態 RNN 的記憶體。LatentMoE 則是改良的 Mixture-of-Experts(MoE)架構,旨在緩解標準 MoE 在低延遲情境下的記憶體頻寬瓶頸,並提升每單位運算量與參數所能達到的準確度。
社群討論
整體對 Kimi K3 的 KDA、NoPE、Latent MoE 等架構創新多有肯定,部分實測認為表現可比 Opus 4.7/4.8,尤其擅長前端與網站動態設計;也有留言補充 KDA 類似可平行訓練的 RNN,其狀態更新可能承擔位置資訊。主要質疑集中在線性注意力可能有損、文件能否完整重現、Cursor 用量成本偏高,以及近期實作品質不穩:有人遇到工具呼叫失敗與無止境思考,K2.6 解題超過 10 分鐘仍無進展,DeepSeek V4 卻在 1 分鐘內完成;另有人提醒,架構創新並不能否定蒸餾攻擊是否發生。