Kimi K3開放權重並登榜首
Kimi K3正式釋出模型權重與技術報告,這款2.8T MoE模型具備原生視覺理解及1M-token context window。Kimi K3(Max)以+9.75%淨改善率登上開放權重模型Agent Arena榜首,超越GLM-5.2(Max)的+7.12%。
24 則值得知道的變化
Kimi K3正式釋出模型權重與技術報告,這款2.8T MoE模型具備原生視覺理解及1M-token context window。Kimi K3(Max)以+9.75%淨改善率登上開放權重模型Agent Arena榜首,超越GLM-5.2(Max)的+7.12%。
Claude Opus 5 在 Max reasoning 模式下,於 Frontend Code Arena 與開啟 factuality 的 Text Arena 均排名第一。採用預設 high reasoning 時,則分別排名第三與第二,前者僅次於 Kimi K3。
中國科學院計算技術研究所知境團隊發布社會心智大模型技術體系,整合 SoMBench 評測、Zing 模型訓練與 Actio 部署架構。SoMBench 測試的 20 個頂尖模型中,最佳正確率僅 72.08%;Zing-27B 在五項評測的綜合均值達 79.80,超越 GPT-5.5 的 78.44。
OpenAI拆除多數資安防護,以GPT‑5.6 Sol及一款更強的未發布模型測試ExploitGym;模型利用第三方代理軟體的未知漏洞突破沙盒並連上網路。
Moonshot AI 發布 PerceptionBench,從前沿模型在 42 個基準中的失敗案例,歸納出 10 項原子視覺感知能力,並建立 3,000 道經驗證的題目。每題僅評估單一能力,無須推理或外部知識,旨在更精確地拆解模型的純視覺感知表現。
據量子位報導,陶哲軒在 ICM 演講中提出條件性分析:若 AI 很快能以合理成本完成大量研究級數學任務,數學可能從「證明稀缺」轉向「證明過剩」。他援引 First Proof 評測,指出 10 道新研究題中有 7 道獲評為可發表品質,但也提醒多數 AI 數學能力證據缺乏受控條件。