跳到主要內容
2026-08-14 日報
研究與評測

Artificial Analysis 推出自訂評測平台 Optima,支援匯入自有資料與追蹤任務成本

X @ArtificialAnlys單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

Artificial Analysis 宣布推出全新平台 Optima,讓開發者能針對自身工作負載建立自訂的基準測試(benchmark)。 使用者可透過三種方式建立評測:上傳自有檔案或 Hugging Face 的資料集、從 Arize、Braintrust 與 Langfuse 等平台匯入代理追蹤(agent traces),或是直接描述使用案例並提供輸入輸出範例讓系統自動建立。此外,也可安裝 Optima skill 從程式開發環境中獲取上下文來建立。 在評分機制上,Optima 支援客觀評分標準,並導入與 GDPval-AA 及 AA-Briefcase 等官方基準測試相同的成對評審(pairwise judging)方法。系統會根據使用者在樣本中選擇的偏好回應,對整個測試集進行模型排名。 除了模型效能,平台還會同步追蹤「每次任務成本」(Cost per Task)與「每次任務時間」(Time per Task),協助開發者比較各模型的性價比與速度,並支援一鍵在最新模型上執行測試以更新排行榜。
讀原始報導

背景

在開發 AI 應用時,評估不同模型的效能與成本是一大挑戰。Optima 平台可與 Langfuse 等開源 AI 工程平台整合,協助開發者在大型語言模型營運(LLMOps)工作流程中,針對特定應用場景建立自訂的基準測試。

來源

本期分類