研究與評測
Artificial Analysis Intelligence Index 更新至 v4.1.1,評分模型統一替換為 GPT-5.6 Luna
X @ArtificialAnlys單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
Artificial Analysis 宣布將其 Intelligence Index 更新至 v4.1.1 版本。本次更新將 HLE、AA-LCR 與 AA-Omniscience 的評分模型統一替換為 GPT-5.6 Luna (medium),取代原先的 GPT-4o、Qwen3 235B A22B 2507 及 Gemini 3 Flash Preview,以提升與人類判斷的一致性。此外,𝜏³-Banking 更新至 Sierra 的 v1.0.1 版本,改進了評分流程並解決從異常路徑(unhappy paths)恢復時的正確性錯誤。
官方表示,整體模型排名基本保持一致,多數模型在 Intelligence Index 上的變動小於 1 分。Claude Opus 5 仍以 63 分維持第一;Muse Spark 1.2 (xhigh) 的分數增加最多(+2.7 分)。目前網站上公布的所有模型分數均已反映此 v4.1.1 版本的變更。
讀原始報導這則事件的發展
本期分類