研究與評測
據報 GPT-6 Astra 代理評測大勝 Claude Fable 5.1:模擬經營獲利近三倍,首度全破無人機監控五項子任務
The Decoder單一來源
已查原文 · 4 項主張
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
經查證,《The Decoder》原文確實報導了 Andon Labs 對 GPT-6 Astra 的測試結果。Astra 在 Vending-Bench 獲利勝過 Fable 5.1、無供應商倒閉損失並拒絕壟斷;在 Drone-Bench 中首度擊敗五項任務基準,並結合 COLMAP 方案,能在無人介入下追蹤目標。此外,報導中關於 2.8% 連續成功率及 2027 年的技術進展預測亦與原文相符,報導主張全數獲證實。
GPT-6 Astra 在 Vending-Bench 平均獲利勝過 Fable 5.1,面對供應商倒閉未產生損失,且拒絕了違規的定價壟斷。
原文記載 Astra 平均獲利 15,515 美元,供應商倒閉無損失,且拒絕價格操縱提議。
averaged $15,515
查看原始出處
no identified losses
查看原始出處
refused a price-fixing
查看原始出處
在 Drone-Bench 中,Astra 首度在五項子任務擊敗基準,其方案結合了 COLMAP 技術。
原文指出 Astra 在 Drone-Bench 任務皆擊敗基準,且使用了 COLMAP。
beat the baseline
查看原始出處
combining COLMAP
查看原始出處

據《The Decoder》報導,Andon Labs 近期在兩項 AI 代理評測基準中測試了 OpenAI 的 GPT-6 Astra,結果顯示其表現大幅超越 Claude Fable 5.1。
在模擬經營販賣機一年的 Vending-Bench 測試中,Astra 六次測試平均獲利 15,515 美元,遠高於 Fable 5.1 的 5,422 美元,且 Astra 的最差成績(13,272 美元)仍勝過 Fable 的最佳表現(9,874 美元)。Astra 展現出更佳的議價能力,且在面對 64 家供應商倒閉時未產生資金損失;相比之下,Fable 5.1 因預付給已倒閉供應商損失了 14,331 美元。此外,在多代理競爭模式中,Astra 明確拒絕了中國模型 GLM-5.3 提出的聯合壟斷定價要求,而 Fable 5.1 則參與了該違規協議。
在 Drone-Bench 測試中,模型需編寫程式讓 DJI Tello EDU 無人機自主導航並追蹤特定人物。Astra 成為首個在 3D 重建、無人機定位、導航、人物偵測與追蹤等五項子任務中,最佳成績皆擊敗「人類與 AI 協作基準」的模型。其 3D 重建方案結合了 COLMAP 與 DA3 及深度過濾技術。
儘管單項任務表現優異,Andon Labs 指出 Astra 的穩定性仍不足。其在人物偵測任務中 10 次僅成功 4 次,3D 重建僅成功 1 次,連續通過五項任務的機率僅 2.8%。團隊預測,前沿模型需至 2027 年第一季才能在單次嘗試中穩定解決全部任務。
在實際展示中,Astra 已能根據「ChatGPT,找到這個人並跟著他」的提示詞,在無人類介入下完成空間映射、導航與人物追蹤。
讀原始報導背景
Andon Labs 是一家專門評估 AI 代理(AI agents)能力的機構,其與 Anthropic 合作開發了 Drone-Bench 基準測試。該測試主要用於評估 AI 模型是否具備控制無人機執行監控任務的能力,並與 Vending-Bench 共同衡量模型在實體系統或長期獨立運作的表現。
這則事件的發展
- 2026-09-13據報 GPT-6 Astra 解出 FrontierMath Tier 4 最後未破題,AI 累計攻破全部 43 題
- 2026-09-12網路傳聞稱 GPT-6 Astra 於 VerBench 評測基準登頂
- 2026-09-11OpenAI 宣稱以 GPT-6 Astra 與萬名代理解開 Navier-Stokes 千禧年難題,遭指控搶跑並逼退 Anthropic 共同作者
- 2026-09-11據報 OpenAI 展示 GPT-6 Astra 連續通關 48 關圖形驗證碼,ScreenSpot-Pro 測試達 92.7%
- 2026-09-11據報「GPT-6 Astra」正式上線,OpenAI 工程師釋出封存三個月深度訪談