跳到主要內容
2026-09-09 日報
研究與評測

據報導 GPT-6 Astra 以 1,797 分奪 LMArena 程式榜首,Fable 5.1 則於 Intelligence Index 守住第一

INSIDE單一來源
查得來源差異

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

待查報導的多項成績評比、幻覺率及定價數據等主張,皆與所引述的原始評測新聞相符。但關於 token 消耗的部分,原文是陳述前代模型(SOL)的消耗高出 70% 或 Astra 的效率提升 70%,而非 Astra 的消耗「減少」70%,兩者數學意義並不相同,因而在此細節上產生抵觸。

GPT-6 Astra 以 1,797 分奪 LMArena 程式榜首

原文支持 GPT-6 Astra 於 Code Arena WebDev 排行中以 1,797 分奪冠的主張。

GPT-6 Astra 在 Code Arena WebDev 排行以 1,797 分奪冠

查看原始出處

Claude Fable 5.1 在 Intelligence Index 以 66 分領先 Astra 的 61 分

原文明確指出 Claude Fable 5.1 獲得 66 分並領先 Astra 的 61 分。

Claude Fable 5.1 以 66 分領先 Astra 的 61 分

查看原始出處

Claude Fable 5.1 在 Coding Agent Index(70 對 67 分)與 OSWorld 2.0 桌面操作能力中勝出

原文支持 Fable 5.1 在上述兩項評比中皆勝出。

Fable 以 70 對 67 勝出

查看原始出處

OSWorld 2.0(桌面操作能力)也是 Fable 的勝場

查看原始出處

Astra 在 Frontier Math Tier 4 拿下 97.6%(Fable 5.1 為 87.8%)

原文提到 Astra 拿下 97.6%,而 Fable 則是 87.8%。

Frontier Math Tier 4 拿下 97.6%,Fable 87.8%

查看原始出處

Astra 在 Bench CAD 3D 物件建模以 95.9% 領先對手的 85%

原文明確提到 Astra 在 Bench CAD 中以約 95.9% 領先對手。

Bench CAD(3D 物件建模)Astra 同樣勝出近 10 個百分點,約 95.9% 對 85%

查看原始出處

Astra 在 AutomationBench 與 Terminal-Bench 系列勝出

原文支持這兩項系列由 Astra 領先。

AutomationBench 與 Terminal-Bench 系列也以 Astra 領先

查看原始出處

與前代 GPT-5.6 SOL 相比,兩者在 Intelligence Index 同為 61 分

原文明確提到 SOL 與 Astra 在此指標上均為 61 分。

SOL 與 Astra 在 Intelligence Index 同為 61 分

查看原始出處

Astra 的幻覺率降至 51%(SOL 為 92%)

原文數據支持 SOL 為 92%,Astra 為 51%。

SOL 的幻覺率是 Astra 的兩倍(92% 對 51%)

查看原始出處

編碼任務的 token 消耗減少 70%

原文是指出前代 SOL 的 token 消耗「高出 70%」,或是 Astra 的「token 效率提升 70%」,而非 Astra 消耗「減少 70%」。

在編碼任務上的 token 消耗也高出 70%

查看原始出處

token 效率比 SOL 提升 70%

查看原始出處

Astra 定價不到 Claude Fable 5 的一半

原文證實 Astra 定價不及 Claude Fable 5 的一半。

定價卻不到 Claude Fable 5 的一半

查看原始出處
據報導,OpenAI 推出 GPT-6 Astra 限量預覽版後,第三方評測平台 LMArena 數據顯示,Astra 在 Code Arena WebDev 排行以 1,797 分奪冠。 然而根據 Artificial Analysis 評測,Claude Fable 5.1 在 Intelligence Index 以 66 分領先 Astra 的 61 分,並在 Coding Agent Index(70 對 67 分)與 OSWorld 2.0 桌面操作能力中勝出。 Astra 的優勢集中於特定領域,在 Frontier Math Tier 4 拿下 97.6%(Fable 5.1 為 87.8%),Bench CAD 3D 物件建模以 95.9% 領先對手的 85%,並在 AutomationBench 與 Terminal-Bench 系列勝出。 與前代 GPT-5.6 SOL 相比,兩者在 Intelligence Index 同為 61 分,但 Astra 的幻覺率降至 51%(SOL 為 92%),編碼任務的 token 消耗減少 70%,且定價不到 Claude Fable 5 的一半。
讀原始報導

背景

LMArena(前身為 Chatbot Arena)是一個公開的網頁評測平台,透過讓使用者對兩個匿名大型語言模型的回應進行盲測投票來決定排名。而新聞中提到的 OSWorld 2.0 則是一個用於基準測試(Benchmarking)的專案。

來源

本期分類