AWS 開源 AI 代理基準測試 aws-bench,於真實雲端帳戶執行任務並由 LLM 或程式化驗證評分
工具基於 Harbor 框架構建,支援 Claude Code 等代理,目前僅限 us-east-1 區域且尚未發布官方排行榜。
68 則值得知道的變化
工具基於 Harbor 框架構建,支援 Claude Code 等代理,目前僅限 us-east-1 區域且尚未發布官方排行榜。
支援 3.7 Flash 等模型,打破固定幀率限制,讓模型自主決定觀看片段與模態,未來將導入 YouTube 的「Ask YouTube」問答功能。
該專案於 8 月 4 日以 Apache 2.0 授權開源,底層呼叫 Kiro 命令行工具,提供任務排程、失敗重試與記憶審計功能,讓 Agent 能在無人值守下執行長期軟體工程任務。
上萬個 dsh-plugin 儲存庫僅不到千個可用。實測顯示外掛能繞過唯讀設定讀取私鑰,且安裝會導致模型 KV 快取失效與嚴重的介面衝突。
SafeMind 內建於 Falcon 平台,於數位孿生環境中執行紅藍對抗演練;另同步推出由逾 50 個代理協作的 Falcon IQ 引擎。
該設備具備 26 TOPS 算力,透過 HDMI 與 USB 接入現有電腦,主打在本地端學習用戶工作習慣以更新模型參數,預計 9 月上線。
此工具基於 aisuite 打造,可串接 OpenAI 與 Slack 等辦公軟體執行自動化任務,但自帶模型設計將 API 配置與除錯成本轉嫁給使用者。
平台提供 2 至 6 個代理的預設編組,透過握手協定傳遞任務並附帶網頁儀表板,旨在以系統架構約束 AI 產出品質,取代人工逐行審查程式碼。
該平台可持續驗證 AI 代理使用的外掛與 MCP 伺服器,目前已過濾網路上約 27% 的高風險技能,並獲紅杉資本等機構投資。
資金將用於開發代理原生工具,其開放平台允許客戶整合既有 EDA 軟體,建立可持續學習的專屬 AI 代理工作流程。
為防範低品質 AI 生成程式碼,Flue 與 tldraw 自動關閉外部提交;Vercel 導入代理系統四週即解決近八成積壓問題。