微軟與 Hugging Face 發布 AI Agent 評測基準 ThinkingBox:以資料庫真實狀態為準,Claude Opus 5.5 奪冠測試 507 個業務工作流程發現,67.24% 的失敗案例表面正常終止且無報錯,凸顯僅檢查工具呼叫無法反映真實的資料庫執行結果。HuggingFace Blog一手來源
據報中國全新具身智慧模型在 Meta-World 基準測試以 91.9 分登頂一款全新的中國具身智慧模型在針對實體任務的 Meta-World 基準測試中取得 91.9 分,宣稱位居全球 AI 排名首位。Reddit r/singularity單一來源
據報 OpenAI 發布 GPT-6.1 Sol 定價為 Astra 兩成,Anthropic Sonnet 5.5 空降 Agent Arena 第三名GPT-6.1 Sol 每百萬代幣輸入與輸出定價為 2 與 10 美元,任務成本較 Astra 便宜 81%;Gemini 4 Argon 則登頂 Text Arena 排行榜。Latent Space單一來源