據報導 GPT-6 Astra 以 1,797 分奪 LMArena 程式榜首,Fable 5.1 則於 Intelligence Index 守住第一
查得來源差異
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
待查報導的多項成績評比、幻覺率及定價數據等主張,皆與所引述的原始評測新聞相符。但關於 token 消耗的部分,原文是陳述前代模型(SOL)的消耗高出 70% 或 Astra 的效率提升 70%,而非 Astra 的消耗「減少」70%,兩者數學意義並不相同,因而在此細節上產生抵觸。
GPT-6 Astra 以 1,797 分奪 LMArena 程式榜首
原文支持 GPT-6 Astra 於 Code Arena WebDev 排行中以 1,797 分奪冠的主張。
GPT-6 Astra 在 Code Arena WebDev 排行以 1,797 分奪冠
查看原始出處
Claude Fable 5.1 在 Intelligence Index 以 66 分領先 Astra 的 61 分
原文明確指出 Claude Fable 5.1 獲得 66 分並領先 Astra 的 61 分。
Claude Fable 5.1 以 66 分領先 Astra 的 61 分
查看原始出處
Claude Fable 5.1 在 Coding Agent Index(70 對 67 分)與 OSWorld 2.0 桌面操作能力中勝出
原文支持 Fable 5.1 在上述兩項評比中皆勝出。
Fable 以 70 對 67 勝出
查看原始出處
OSWorld 2.0(桌面操作能力)也是 Fable 的勝場
查看原始出處
Astra 在 Frontier Math Tier 4 拿下 97.6%(Fable 5.1 為 87.8%)
原文提到 Astra 拿下 97.6%,而 Fable 則是 87.8%。
Frontier Math Tier 4 拿下 97.6%,Fable 87.8%
查看原始出處
Astra 在 Bench CAD 3D 物件建模以 95.9% 領先對手的 85%
原文明確提到 Astra 在 Bench CAD 中以約 95.9% 領先對手。
Bench CAD(3D 物件建模)Astra 同樣勝出近 10 個百分點,約 95.9% 對 85%
查看原始出處
Astra 在 AutomationBench 與 Terminal-Bench 系列勝出
原文支持這兩項系列由 Astra 領先。
AutomationBench 與 Terminal-Bench 系列也以 Astra 領先
查看原始出處
與前代 GPT-5.6 SOL 相比,兩者在 Intelligence Index 同為 61 分
原文明確提到 SOL 與 Astra 在此指標上均為 61 分。
SOL 與 Astra 在 Intelligence Index 同為 61 分
查看原始出處

背景
LMArena(前身為 Chatbot Arena)是一個公開的網頁評測平台,透過讓使用者對兩個匿名大型語言模型的回應進行盲測投票來決定排名。而新聞中提到的 OSWorld 2.0 則是一個用於基準測試(Benchmarking)的專案。