研究與評測
OceanBase 結合 GLM-5.2 登頂 Data Agent Benchmark,以 90.62% 準確率超越 GPT 與 Claude 方案
AI 科技評論綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
OceanBase 團隊提交的 Data Agent 方案(內部代號 Scout)登頂國際 Data Agent Benchmark (DAB),以 90.62% 的準確率位列第一,成為該榜單首個突破 90% 的方案。該方案基於 GLM-5.2 模型構建,成績超越多項基於 GPT、Claude Opus、Claude Fable 等海外模型構建的方案。
DAB 由 UC Berkeley EPIC Data Lab 與 Hasura PromptQL 合作推出,涵蓋金融、生物醫學等多個領域,並涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等多種資料庫。與傳統 Text-to-SQL 不同,DAB 更關注 AI 在真實資料環境中,從複雜、分散的資料中完成理解、選擇、規劃、查詢與驗證的完整能力。
OceanBase 方案透過 DataLens 構建資料畫像以識別欄位與關係,並具備證據追蹤和答案校驗功能,形成「資料理解—規劃執行—驗證修復」的閉環。相關技術能力未來將整合至 OceanBase DataPilot 產品中。
讀原始報導背景
Data Agent Benchmark (DAB) 是由加州大學柏克萊分校 EPIC Data Lab 與 Hasura PromptQL 合作推出的基準測試,有別於傳統的 Text-to-SQL,其更著重評估 AI 在真實資料環境中完成分析與驗證的綜合能力。其中,Hasura PromptQL 是一種專門用於資料存取與分析的自然語言 API。
來源
- AI 前線infoq.cn
- github.com