研究與評測
AWS 開源 AI 代理基準測試 aws-bench,於真實雲端帳戶執行任務並由 LLM 或程式化驗證評分
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
AWS 發布開源基準測試工具 aws-bench(採 Apache-2.0 授權),用於評估 AI 代理完成診斷配置錯誤、配置基礎設施及營運即時雲端環境等真實 AWS 任務的準確性。
與傳統靜態環境不同,該工具透過 CDK 堆疊在隔離的真實 AWS 帳戶中部署場景,代理在沙盒容器中使用限定範圍憑證執行任務。任務完成後,由 LLM 評判器或對即時 AWS 狀態的程式化檢查進行自動化驗證評分。
專案基於開源框架 Harbor 構建,內建轉接器支援 Claude Code、Codex、Kiro CLI、Mini-SWE-Agent,以及 Harbor 原有支援的 Gemini CLI 與 OpenCode。預先定義的資料集涵蓋可觀測性、運算與資料、無伺服器、多服務故障排除等基礎與進階任務。
執行該測試需具備組織管理帳戶憑證與權限,目前僅限 us-east-1 區域,且會建立可能產生費用的持久化資源。AWS 目前尚未公布任何效能指標或標準化排行榜,預計列入未來路線圖。
近期加州大學柏克萊分校研究指出,AI 代理能在未解決任務的情況下於多項基準測試獲得滿分;AWS 官方文件亦提及,aws-bench 多數任務依賴 LLM 評判器自動評估,系統遺留狀態可能導致非預期的任務通過或隨機失敗。
讀原始報導背景
AWS CDK 是亞馬遜開源的軟體開發框架,讓開發者能使用熟悉的程式語言來定義與配置雲端基礎設施。而 Harbor 則是由 Terminal-Bench 團隊所開發的框架,專門用於評估與最佳化 AI 代理及語言模型。
來源
- AI 前線infoq.cn
- en.wikipedia.org
- github.com