兩項設定讓GPT-5.6 Sol分數增三倍
OpenAI表示,GPT-5.6 Sol原先在2D益智遊戲基準ARC-AGI-3僅得7.8%,GPT-5.5則為0.4%。檢查後發現,通用測試框架會在每次操作後丟棄私有推理,使模型無法保留先前所學。
OpenAI News綜合 3 家
19 則值得知道的變化
OpenAI表示,GPT-5.6 Sol原先在2D益智遊戲基準ARC-AGI-3僅得7.8%,GPT-5.5則為0.4%。檢查後發現,通用測試框架會在每次操作後丟棄私有推理,使模型無法保留先前所學。
Arena.ai公布,逾7,000次實際代理工作階段顯示,Claude Opus 5 Max以11.88%淨改善率居Agent Arena第2,僅次Fable 5;High版以11.73%居第3,兩者均勝GPT-5.6 Sol (xHigh)。
SpaceXAI於2026年7月29日發布Grok Voice Think Fast 2.0,主打提升智慧、轉錄準確度、對話能力與工具使用可靠性。
實在 Agent 以 90.2% 總成功率、325.59 分總成績,拿下 OSWorld 總榜與 Agentic Framework 分榜冠軍,刷新 Computer-Use Agent 公開評測紀錄。OSWorld 在 Ubuntu 真實作業系統中測試 361 項任務,涵蓋跨軟體協作、圖像處理與系統操作。
據量子位報導,無問芯穹公開跨叢集異質推論架構 PDD 與完整技術報告,透過 RLD 中繼及 Token 重算,降低廣域網路傳輸 KV Cache 的延遲。其在 DeepSeek-V4-pro 與真實 Agentic 工作負載測試中,首 Token 延遲最高降低 51.5%,單 Token 成本降低 37.5%。