Claude Opus 5.5 (High) 獲 1509 分登頂 Text Arena,Anthropic 包辦前六名
模型於 2026 年 7 月上線,開放 Pro 與 Max 方案用戶使用。其評分較 Opus 5 提升 18 分,並以 4 分之差領先位居第二的 Opus 4.6。
X @arena單一來源
34 則值得知道的變化
模型於 2026 年 7 月上線,開放 Pro 與 Max 方案用戶使用。其評分較 Opus 5 提升 18 分,並以 4 分之差領先位居第二的 Opus 4.6。
模型接受狀態、問題 schema 與圖片輸入,透過結構化候選評分機制,無須呼叫生成函數即可返回 JSON 答案。
成立僅三個月的 Simate 已獲數億元人民幣融資,其模型主打 4D 物理感知與分層時序記憶,以 33.95 分位居榜首,並開放 AI 驅動平台供高校內測。
針對現有 VLA 模型缺乏物理感知的局限,新模型透過三大模組即時預判摩擦與重心變化,配套的 RoboTwin-Phys 評測基準與資料集已全面開源。
該模型在困難基準測試中開啟擴展推理後得分為 68.9%,雖不及 Jev 的 74.1%,但為該領域提供了可本機部署的開源新選擇。
Reddit 社群流傳 Swift 1.5 27b 模型發布消息,發文者稱其為速度更快的 Qwen 模型,但目前尚無具體的實測數據與官方細節。
總參數 14B,深度圖測試擊敗 Depth Anything V2。目前無 GGUF 格式且為非商業授權,官方僅在 80GB A800 驗證過部署。