模型發布
OpenAI 發布 GPT-6 Astra 模型:專注電腦操作與程式開發,支援百萬 token 並具備關鍵網安能力
AI 前線單一來源
已查原文 · 1 項主張
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
報導所述之 GPT-6 Astra 核心規格與硬體訓練規模,皆與原文明確相符。
據報導,OpenAI 發布專注於電腦應用、程式開發與專業工作流程的新模型 GPT-6 Astra,目前正逐步向 ChatGPT Plus、Pro、Business 和 Enterprise 用戶,以及 OpenAI API、Microsoft Azure 和 AWS Bedrock 平台推出。
該模型將應用範圍擴展至直接在軟體中執行多步驟任務,能與圖形介面互動以填寫表單、分析資料或排查畫面問題。在 OSWorld 2.0 測試中,Astra 得分達 72.6%,超越前代 GPT-5.6 Sol 的 65.7%。
程式能力方面,Astra 在 Terminal-Bench 4.0 得分為 57.9%,DeepSWE v1.1 達 74.1%。OpenAI 在 Codex 中引入實驗性上下文機制,允許代理在不同上下文視窗間保留筆記,使模型在長時間任務中能檢索早期需求與測試結果。據 OpenAI 報告,Astra 支援 100 萬 token 長上下文,在 512K 至 1M 區間的 MRCR 評估得分為 96.3%,且內部評估的幻覺率為 4.2%(GPT-5.6 Sol 為 12.2%)。
在網路安全方面,根據 OpenAI 的 Preparedness Framework,Astra 是首個被歸類為「關鍵網路安全能力」級別的模型。在無生產環境安全防護的測試中,該模型曾發現並利用兩個未知漏洞;生產版本已限制進階攻擊任務,OpenAI 計劃透過 Daybreak 計畫提供防禦能力。此外,測試發現 Astra 的書面推理比前代模型更難監控。
NVIDIA 執行長黃仁勳透露,GPT-6 Astra 是在超過 10 萬塊 NVIDIA Grace Blackwell NVLink72 上完成訓練,並預告接下來將有 40 萬塊 GPU 投入使用。
與競品對比的評測顯示,Astra 在 Terminal-Bench 4.0 及多項電腦操作評估中領先 Anthropic Claude Fable 5.1 與 Google Gemini 3.8 Flash;但在 Humanity's Last Exam 測試中得分不及 Claude Fable 5.1,且 Astra 不支援 Gemini 3.8 Flash 所具備的原生影音輸入功能。
讀原始報導這則事件的發展
- 2026-09-15GPT-6 Astra據報推向ChatGPT Work、Codex與API,輸入/輸出每百萬token 10/50美元起
- 2026-09-14據報 GPT-6 Astra 代理評測大勝 Claude Fable 5.1:模擬經營獲利近三倍,首度全破無人機監控五項子任務
- 2026-09-14傳黃仁勳稱 AGI 已到來:OpenAI GPT-6 Astra 採逾 10 萬台 NVL72 訓練
- 2026-09-13據報 GPT-6 Astra 解出 FrontierMath Tier 4 最後未破題,AI 累計攻破全部 43 題
- 2026-09-12網路傳聞稱 GPT-6 Astra 於 VerBench 評測基準登頂