中科院發布社會心智AI體系
中國科學院計算技術研究所知境團隊發布社會心智大模型技術體系,整合 SoMBench 評測、Zing 模型訓練與 Actio 部署架構。SoMBench 測試的 20 個頂尖模型中,最佳正確率僅 72.08%;Zing-27B 在五項評測的綜合均值達 79.80,超越 GPT-5.5 的 78.44。
量子位
24 則值得知道的變化
中國科學院計算技術研究所知境團隊發布社會心智大模型技術體系,整合 SoMBench 評測、Zing 模型訓練與 Actio 部署架構。SoMBench 測試的 20 個頂尖模型中,最佳正確率僅 72.08%;Zing-27B 在五項評測的綜合均值達 79.80,超越 GPT-5.5 的 78.44。
Moonshot AI 發布 PerceptionBench,從前沿模型在 42 個基準中的失敗案例,歸納出 10 項原子視覺感知能力,並建立 3,000 道經驗證的題目。每題僅評估單一能力,無須推理或外部知識,旨在更精確地拆解模型的純視覺感知表現。
據量子位報導,陶哲軒在 ICM 演講中提出條件性分析:若 AI 很快能以合理成本完成大量研究級數學任務,數學可能從「證明稀缺」轉向「證明過剩」。他援引 First Proof 評測,指出 10 道新研究題中有 7 道獲評為可發表品質,但也提醒多數 AI 數學能力證據缺乏受控條件。