跳到主要內容
2026-07-30 日報
研究與評測

兩項設定讓GPT-5.6 Sol分數增三倍

OpenAI News綜合 3 家報導
OpenAI表示,GPT-5.6 Sol原先在2D益智遊戲基準ARC-AGI-3僅得7.8%,GPT-5.5則為0.4%。檢查後發現,通用測試框架會在每次操作後丟棄私有推理,使模型無法保留先前所學。啟用ChatGPT與Codex使用的retained reasoning及compaction後,公開任務集分數增至三倍,輸出token降至原本六分之一,OpenAI並稱其達到SoTA。
讀原始報導

背景

ARC-AGI-3 是一項互動式推理基準,要求 AI 代理探索陌生環境、即時掌握目標、建立可調整的世界模型,並持續學習。OpenAI 的 Responses API 支援管理推理 token 與跨回合保留推理狀態;其測試顯示,保留推理並啟用 compaction,可提升 GPT-5.6 在 ARC-AGI-3 的分數與效率。

來源

本期分類