跳到主要內容
2026-09-02 日報
研究與評測

Allen AI 推出 BenchMIRT 評測分析方法,以多維度 IRT 拆解 16 項基準測試,發現 BBQ 與 WMDP 實際更偏向一般推理

HuggingFace Blog一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Allen AI 推出 BenchMIRT,這是一種在單一提示(prompt)層級審查 LLM 基準測試的新方法。該方法引入心理測量學的多維度項目反應理論(MIRT),可分離出影響同一題目表現的多種潛在能力,並評估題目的難度與鑑別度。研究團隊使用 100 款 LLM 在 16 項基準測試(包含 MMLU-Pro 等 6 項推理測試與 HarmBench 等 10 項 Olmo 3 安全測試)、超過 3.4 萬道題目的結果來訓練 BenchMIRT。在未預先告知測試目標的情況下,BenchMIRT 獨立還原出「安全性」與「一般推理」兩個主要維度。分析結果揭露部分基準測試的實際測量維度與預期不同:評估社會偏見的 BBQ 測試,其結果與一般推理能力的關聯度遠高於安全性;測試危險雙用途知識的 WMDP 也更偏向一般推理,且推理能力越強的模型得分越低(因拒答被視為預期反應)。此外,單一測試也可能混雜不同訊號,例如 HarmBench 的標準與上下文題目偏向安全性,但版權相關題目則更依賴一般推理能力。
讀原始報導

背景

評估大型語言模型(LLM)的基準測試通常包含多種任務,例如「BBQ」是一個專門用於問答的偏差基準測試,旨在凸顯針對受保護群體的社會偏見。然而,單一測試中的不同問題往往會牽涉到模型的多重能力,導致將所有結果平均成單一分數時,難以反映出模型真實的各項指標。

來源

本期分類