研究與評測
據報 GPT-6 Astra 解出 FrontierMath Tier 4 最後未破題,AI 累計攻破全部 43 題
量子位單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
本次未取得足夠原文證據

量子位報導,GPT-6 Astra 解出了 FrontierMath Tier 4 此前唯一尚未被 AI 成功解答的題目;依 Epoch AI 的累計計算方式,不同模型與不同時間的成功紀錄合併後,Tier 4 的 43 道題都至少曾被 AI 解出一次,因此被判定為「飽和」。這不代表 Astra 單次測試解出全部題目;OpenAI 公布的 Astra 成績為 97.6%。
FrontierMath Tier 4 於 2025 年推出,最初收錄 50 道由數學教授與博士後設計的研究級題目,涵蓋分析、數論、組合數學、拓撲與代數幾何等領域。Epoch AI 在 2026 年 6 月發布 v2,修正 12 道題並移除 7 道題,題數降至 43 道。報導稱,GPT-5.6 Sol 在修訂版取得 83.0%,Claude Fable 5 為 90.2%,GPT-6 Astra 則達 97.6%。
FrontierMath 最初於 2024 年 11 月 7 日發布,核心題庫原有 300 道題,分為 Tier 1 至 Tier 3;2025 年再加入 Tier 4。Tier 4 最初發布時,所有模型歷次測試合計僅解出 3 題,且部分答案依賴正確但未充分論證的假設;2025 年 7 月 11 日 Tier 4 推出時,排行榜最高成績約為 5%。
出題人、馬凱特大學數學副教授 Jay Pantone 表示,過去 AI 常尋找數值捷徑,但這次 Astra 的解法與他的解法相當接近。報導也指出,FrontierMath 已新增真正的 Open Problems,以及要求 AI 將 Erdős 開放問題形式化為 Lean 證明的 FrontierMath Erdős;Astra 在其中 68 道題僅解出 2 道,因此 Tier 4 被攻破不等於數學問題已由 AI 解決。上述結果目前只有量子位單一來源報導,尚無其他佐證材料。
讀原始報導背景
FrontierMath 是由非營利研究機構 Epoch AI 於 2024 年 11 月推出的數學基準測試,旨在評估 AI 系統解決原創且未經檢驗的數學難題的能力。該題庫由數十位數學家共同設計,題目難度涵蓋大學至博士研究層級,被視為檢驗大模型數學推理能力的防線。
這則事件的發展
- 2026-09-12網路傳聞稱 GPT-6 Astra 於 VerBench 評測基準登頂
- 2026-09-11OpenAI 宣稱以 GPT-6 Astra 與萬名代理解開 Navier-Stokes 千禧年難題,遭指控搶跑並逼退 Anthropic 共同作者
- 2026-09-11據報 OpenAI 展示 GPT-6 Astra 連續通關 48 關圖形驗證碼,ScreenSpot-Pro 測試達 92.7%
- 2026-09-11據報「GPT-6 Astra」正式上線,OpenAI 工程師釋出封存三個月深度訪談
- 2026-09-10LangChain 洩漏 OpenAI 未公開模型 GPT-6 Astra,該模型解出千禧年數學難題並引發學術爭議