跳到主要內容
2026-07-18 日報
研究與評測

Arena新增事實性排名

X @arena
Arena.ai 正式在 Text Arena 與 Search Arena 上線非預設的事實性切換排名,依人類偏好與事實性的加權組合重新排列模型。排名以超過 200 萬條 LLM 真實對話主張的標註結果為基礎,其中 Text Arena 超過 130 萬條、Search Arena 超過 70 萬條。啟用事實性後,GPT-5.5 上升 13 名至第 7,Claude Fable 5 小幅降至第 2,顯示事實正確性與人類偏好會產生不同的模型比較結果。
讀原始報導

背景

Bradley–Terry model常用於根據競賽中的勝負等成對比較結果,推估各對象的參數;在偏好式獎勵建模中,它採用對數概似損失與反對稱結構。M-estimator的漸近理論可支援Wald型信賴區間與假設檢定,但也可透過排列法或bootstrap檢查其分布。

來源

本期分類