跳到主要內容
2026-08-07 日報
研究與評測

Artificial Analysis Intelligence Index 更新至 v4.1.1,評分模型統一替換為 GPT-5.6 Luna

X @ArtificialAnlys單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Artificial Analysis 宣布將其 Intelligence Index 更新至 v4.1.1 版本。本次更新將 HLE、AA-LCR 與 AA-Omniscience 的評分模型統一替換為 GPT-5.6 Luna (medium),取代原先的 GPT-4o、Qwen3 235B A22B 2507 及 Gemini 3 Flash Preview,以提升與人類判斷的一致性。此外,𝜏³-Banking 更新至 Sierra 的 v1.0.1 版本,改進了評分流程並解決從異常路徑(unhappy paths)恢復時的正確性錯誤。 官方表示,整體模型排名基本保持一致,多數模型在 Intelligence Index 上的變動小於 1 分。Claude Opus 5 仍以 63 分維持第一;Muse Spark 1.2 (xhigh) 的分數增加最多(+2.7 分)。目前網站上公布的所有模型分數均已反映此 v4.1.1 版本的變更。
讀原始報導

這則事件的發展

  1. 2026-08-06Artificial Analysis 發布模型任務耗時帕雷托前沿:2 分鐘內皆為 OpenAI,長耗時由 Anthropic 占據
本期分類