研究與評測
Arena 推出 AutoEval 評測方法:以千萬筆人類對戰紀錄訓練 reward model,將評估週期縮短至數小時
X @arena綜合 2 家報導單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
Arena 宣布推出 AutoEval 評測方法,利用數千萬筆歷史人類對戰紀錄訓練 reward model,以大規模估算人類偏好。官方表示,AutoEval 將評估回饋週期從數週大幅縮短至數小時,讓模型實驗室能快速取得基於人類偏好的能力洞察。有別於傳統的 LLM-as-judge 方法,AutoEval 維持動態基準(live benchmark)特性,其模型直接根據真實世界的人類提示詞與模型回覆進行評分。該專案由 Arena 機器學習工程師 Haoran Guo 與 Wayne Zhang 參與開發。
讀原始報導背景
在自然語言處理領域,常使用「LLM-as-a-Judge」技術讓大型語言模型來評估文字輸出的品質,作為人工標註的低成本替代方案。而新推出的 Arena AutoEval 則有別於此,其利用數千萬筆真實的人類對戰紀錄來訓練獎勵模型,藉此大規模預測人類偏好並維持動態的基準測試。
來源
- X @arenanitter.net
- en.wikipedia.org
本期分類