Claude Opus 5.5 (High) 獲 1509 分登頂 Text Arena,Anthropic 包辦前六名
模型於 2026 年 7 月上線,開放 Pro 與 Max 方案用戶使用。其評分較 Opus 5 提升 18 分,並以 4 分之差領先位居第二的 Opus 4.6。
X @arena單一來源
34 則值得知道的變化
模型於 2026 年 7 月上線,開放 Pro 與 Max 方案用戶使用。其評分較 Opus 5 提升 18 分,並以 4 分之差領先位居第二的 Opus 4.6。
測試要求模型比對照片與 PDF 說明書找出錯誤。GPT-6 Astra 每張照片耗時 3 分鐘,擊敗 Claude Fable 5.1 的 70%。
由 vLLM 團隊創立的 Inferact 透過 Pallas 語言整合推論程式,搭配 DeepSeek 框架,在 16 塊 TPU 上跑出每秒 709 token 的成績。
採 Apache 2.0 授權,將檔案選擇交由確定性邏輯處理以降低消耗。專家指出其召回率上限僅 20%,且難以挖掘跨檔案架構問題。
針對現有 VLA 模型缺乏物理感知的局限,新模型透過三大模組即時預判摩擦與重心變化,配套的 RoboTwin-Phys 評測基準與資料集已全面開源。
該模型在困難基準測試中開啟擴展推理後得分為 68.9%,雖不及 Jev 的 74.1%,但為該領域提供了可本機部署的開源新選擇。