跳到主要內容
2026-08-10 日報
研究與評測

Harvey AI 開源 Legal Agent Benchmark (LAB),以真實法律任務評估 LLM Agent 表現

GitHub Trending (python)單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Harvey AI 在 GitHub 開源 Legal Agent Benchmark (LAB),旨在評估 LLM Agent 在真實法律環境中執行任務的能力。該基準測試由兩部分組成:包含代理指令、文件與評分標準的任務資料集,以及用於執行並評估代理表現的測試框架(execution harness)。專案文件提供完整的併購(M&A)資料室任務教學,涵蓋環境設定、任務檢查、代理執行、評分、報告審查與比較儀表板等端到端流程。其評估方法採用全通過評分標準(All-pass rubric scoring)與 LLM 裁判機制,官方表示未來將持續擴充任務集與優化測試框架。
讀原始報導

背景

Harvey AI 是由 Counsel AI Corporation 開發的生成式 AI 產品,專門為律師事務所與企業法務團隊提供客製化的大型語言模型(LLM)。為了評估 AI 代理在真實法律環境中的表現,該團隊推出了開源的法律代理基準測試(LAB)。

來源

本期分類