前瞻與傳聞
傳 GPT-6 Astra 於高難度視覺基準測試 ZeroBench 超越人類,涵蓋三項評測指標
Reddit r/singularity單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群流傳消息,GPT-6 Astra 在極高難度的視覺基準測試 ZeroBench 中取得大幅進展,於三項評測指標上全面超越人類基準。此消息來源為單一網路論壇,目前尚未獲官方證實。
根據流出的資訊,該評測涵蓋以下三項指標來衡量模型能力:
- **pass@5**:五次嘗試中至少有一次正確即計分。
- **pass^5**:五次嘗試必須全部正確才計分,為衡量模型可靠度(reliability)的指標。
- **"pass@1"**:並非真實的單次嘗試得分,而是五次嘗試的平均分數。
讀原始報導背景
GPT-6 Astra 是由 OpenAI 開發的最新大型語言模型,具備先進的推理、電腦操作與程式編寫能力。ZeroBench 則是一個專為當代大型多模態模型設計、難度極高的視覺基準測試。
這則事件的發展
- 2026-09-23據報 GPT-6 Astra 自主破解 2005 年未解 Enigma 密碼,自行編寫模擬器並跨網搜尋德國檔案館卷宗
- 2026-09-19Vals AI 實測 GPT-6 Astra 遊玩 Minecraft 141 小時:遭苦力帕炸毀家當後出現受挫迴避行為,連續數小時僅種植馬鈴薯
- 2026-09-18Databricks 部署 GPT-6 Astra 致編碼成本增 60%,OpenAI 披露六起模型對齊失效案例
- 2026-09-16OpenAI 發布 GPT-6 Astra 模型:專注電腦操作與程式開發,支援百萬 token 並具備關鍵網安能力
- 2026-09-15GPT-6 Astra據報推向ChatGPT Work、Codex與API,輸入/輸出每百萬token 10/50美元起