跳到主要內容
2026-09-11 日報
前瞻與傳聞

據報 OpenAI 展示 GPT-6 Astra 連續通關 48 關圖形驗證碼,ScreenSpot-Pro 測試達 92.7%

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,OpenAI Labs 成員 Sharif Shameem 於 9 月 7 日展示 GPT-6 Astra 連續完成《I’m Not a Robot》全部 48 關圖形驗證碼。任務涵蓋圖片識別、文字判斷、拖曳、停車、視覺搜尋、節奏控制與邏輯遊戲,Astra 透過觀看螢幕並操作滑鼠鍵盤執行連續動作。 根據 OpenAI 公布的數據,Astra 在無工具條件下的 ScreenSpot-Pro 測試達到 92.7%(GPT-5.6 Sol 為 76.9%);在 OSWorld 2.0 跑分為 72.6%(GPT-5.6 Sol 為 65.7%),模擬任務耗時從約 75 分鐘降至約 40 分鐘。報導指出,該公開影片未揭露完整測試環境,也未說明是否嚴格限制為純像素輸入(pixel-only),因此無法作為嚴謹的純視覺評測基準。 針對現代反機器人系統,報導分析指出 reCAPTCHA v3 與 Cloudflare Turnstile 已將防線轉移至瀏覽器環境、伺服器端風險判斷、TLS 客戶端握手特徵(如 JA3、JA4)及 JavaScript 探測,單純的視覺與 GUI 操作能力尚不足以完全攻破現代安全架構。此外,Cloudflare 今年上線的 Web Bot Auth 已轉向基於 HTTP Message Signatures,要求 Agent 生成 Ed25519 金鑰進行密碼學身分認證,顯示 Web 安全正從人機分類轉向 Agent 的身分與授權驗證。
讀原始報導

背景

ScreenSpot-Pro 是一個專門評估多模態大型語言模型(MLLMs)在專業高解析度環境中,圖形使用者介面(GUI)定位能力的基準測試。該測試包含真實的高解析度圖片,用以檢驗模型將語義理解轉化為實際空間操作的準確度。

這則事件的發展

  1. 2026-09-10LangChain 洩漏 OpenAI 未公開模型 GPT-6 Astra,該模型解出千禧年數學難題並引發學術爭議
  2. 2026-09-10GPT-6 Astra 系統卡揭露網路安全達關鍵閾值且可監控性下降,OpenAI 另透露新內部模型訓練 8 天內即解決數學難題
  3. 2026-09-09OpenAI 證實 GPT-6 Astra 思維鏈監控效力下降,模型無 CoT 執行任務能力大幅提升
  4. 2026-09-09GPT-6 Astra 3D 熱潮燒光付費額度,傳將為所有訂閱者全局重置
  5. 2026-09-08GPT-6 Astra 展現 Blender 自動化能力:包辦 3D 建模與骨架綁定,Bench CAD 跑分達 95.9%

來源