研究與評測
Artificial Analysis 發布 Intelligence Index v4.2:Claude Fable 5.1 登頂總榜,私有測試集權重提升至 40%
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Artificial Analysis 發布 Intelligence Index v4.2,透過導入更複雜的真實任務與私有測試集來防止模型作弊。
本次評測基準有三項重大變動:新增內部評測 `AA-Briefcase`,使用私有測試集評估模型在多週專案、數千份輸入文件中的代理知識工作能力;新增由 Surge AI 建立的 `GDP.pdf`,要求模型在 100 個 PDF、共 4,592 頁中進行單輪專業文件推理;同時移除已被模型刷爆(saturated)的科學推理評測 `GPQA Diamond`。為防止實驗室針對評測最佳化,私有保留測試集的權重已提升至 40%(為 v4.1 的兩倍),涵蓋 AA-Briefcase、AA-Omniscience 及 CritPt 解決方案。
最新榜單結果顯示:
* **總榜**:Anthropic 的 Claude Fable 5.1 排名第一,OpenAI 的 GPT-6 Astra 位居第二(較 GPT-5.6 Sol 提升 4 分)。Meta 排名第三,其後依序為 SpaceXAI、Moonshot/Kimi、Z.AI 與 Google。
* **分項表現**:Claude Fable 5.1 與 Opus 5 在 `AA-Briefcase` 代理任務中領先;GPT-6 Astra 則在 `GDP.pdf` 長文本推理中以 33.2% 的全通過率(All-pass Rate)擊敗 GPT-5.6 Sol(28.2%)與 Claude Fable 5.1(26.2%)。
* **成本與效率**:Anthropic、OpenAI、Meta 與 Z.AI 共同佔據單次任務成本(Cost per Task)的帕雷托前沿(Pareto frontier);GPT-6 Astra 則是前沿模型中最具 Token 效率的模型。
讀原始報導社群討論
社群對 Artificial Analysis v4.2 指標評價兩極,部分人讚賞 Omniscience Index 懲罰幻覺的機制,並肯定 Astra 的極佳效率(得分第二高且輸出 token 第三低)。然而,多數留言強烈質疑其評測的科學性與中立性,批評 AA 將有缺陷的 SciCode 權重從 8% 提升至 10%、依賴已飽和的 Terminal-Bench v2.1,且僅對 Astra 測試多種 effort levels 造成基準假象。許多人認為 AA 為了讓 Astra 分數超越 Sol 而事後調整權重,並指出 Gemini 3.8 與 Muse Spark 1.3 的高排名與實際體驗不符,質疑榜單偏袒特定廠商且淪為公關噱頭。
本期分類