Kaggle 上的 ARC-AGI-3 評測最高分從 7% 躍升至 56%,小型本地模型超越人類平均水準過去 30 天內,受限於 Kaggle 規則的小型本地模型透過測試框架取得突破,在旨在展現人類優勢的基準測試中擊敗一般人類。Reddit r/MachineLearning·綜合 2 家多家報導
StartLux 推出開源決策模型 StartLux-Decision,27B 版本於 31 項基準測試擊敗 Jev 1.13官方釋出 0.8B 至 27B 共五種規模。27B 版本在上海 AI 實驗室七項評測中平均準確率達 91.82%,超越 Jev。鈦媒體單一來源