跳到主要內容
2026-07-28 日報
研究與評測

Moonshot AI 發布 PerceptionBench

X @Kimi_Moonshot
Moonshot AI 發布 PerceptionBench,從前沿模型在 42 個基準中的失敗案例,歸納出 10 項原子視覺感知能力,並建立 3,000 道經驗證的題目。每題僅評估單一能力,無須推理或外部知識,旨在更精確地拆解模型的純視覺感知表現。
讀原始報導

背景

PerceptionBench 是一套將視覺感知拆分為原子能力的評測基準,其能力分類並非預先定義,而是從前沿模型在 42 套基準中的失敗案例歸納而來。它涵蓋 10 種原子感知能力與 3,000 道經驗證的問題,每題只測試單一能力,且不需推理或外部知識即可作答;公開結果顯示,受測頂級模型的正確率仍僅約六成。

來源