Meta AI 挑戰五項 STEM 奧林匹亞競賽:物理理論獲滿分、IMO 奪金牌,全程禁用工具
為測試純粹推理能力,Meta 讓模型在無搜尋、無程式碼與無計算機輔助下參賽,於化學及羅馬尼亞數學大師賽亦達金牌水準。
X @AIatMeta單一來源
71 則值得知道的變化
為測試純粹推理能力,Meta 讓模型在無搜尋、無程式碼與無計算機輔助下參賽,於化學及羅馬尼亞數學大師賽亦達金牌水準。
以每百萬 token 1.25/4.25 美元定價,其智慧表現媲美 Claude Opus 4.8,單次任務成本僅需五分之一。
由於收集真實世界訊號耗時,Arena 於 7 月 30 日推出 AutoEval 分數,為模型提供即時且經過校準的評測結果。
實測顯示兩模型皆成功完成 35 次呼叫,但 LFM2.5-2.6B 輸出達 366 tok/s,僅耗時 19 秒,且該模型可於手機端運行。
本次更新升級 𝜏³-Banking 版本並解決評分錯誤,整體排名基本不變,Claude Opus 5 仍以 63 分位居榜首。