跳到主要內容
2026-09-27 日報
研究與評測

GPT-6 Astra 於 Epoch AI 家具組裝測試達 80% 準確率,10 個月內前沿模型能力提升近三倍

The Decoder綜合 2 家報導多家報導
已查原文 · 6 項主張

多個報導來源提及此事;未必是彼此獨立的證據。

經過對照原始出處與轉載報導,本文關於 Epoch AI 的家具組裝基準測試(FAB)的所有重要主張,包含日期、測試方式、各模型的準確率成績與差距,以及未來的應用潛力,均能在原文中找到精確對應的敘述,因此皆判定為支持(supported)。

Epoch AI 於 9 月 23 日公布家具組裝基準測試結果,測試使用 60 張 IKEA 家具照片。

日期、測試名稱與所使用的照片數量均獲中文來源證實。

9 月 23 日进行了一组家具组装基准测试

查看原始出處

用 60 张宜家家具

查看原始出處

GPT-6 Astra 達到 80% 準確率。

英文原文確認 Astra 模型達到了該準確率。

GPT-6 Astra hits 80%

查看原始出處

Claude Fable 5.1 準確率達 70%。

原文證實該模型準確率為 70%。

Fable 5.1 follows at 70%

查看原始出處

2025 年 11 月最佳模型 Opus 4.5 準確率僅為 28%。

原文確認舊模型的成績。

Claude Opus 4.5) scored 28%

查看原始出處

Kimi K3 等中國開源模型落後領先者至少 7 個月。

原文點名 Kimi K3 模型落後領先者。

Kimi K3 trail leaders

查看原始出處

技術未來有望應用於汽車維修或家電檢修任務。

來源指出此能力與汽車、家電維修有高度相關性。

与汽车维修、家电检修

查看原始出處
Epoch AI 於 9 月 23 日公布家具組裝基準測試(FAB)結果,OpenAI 的 GPT-6 Astra 以 80% 準確率位居榜首。該測試使用 60 張故意錯誤組裝的三款 IKEA 家具照片,模型會同時獲得組裝照片、官方 PDF 說明書、圖片放大工具以及 Python 直譯器,需判斷零件是否裝反、順序錯誤或遺漏,並指出具體出錯步驟與問題描述。 在效能表現上,GPT-6 Astra 準確率達 80%,處理每張照片耗時約 3 分鐘。Anthropic 的 Claude Fable 5.1 與 Claude Opus 5 分別以 70% 和 61% 緊隨其後。相較於 2025 年 11 月最佳模型 Claude Opus 4.5 僅 28% 的準確率,前沿模型在 10 個月內提升近三倍。此外,Kimi K3 等中國開源模型在該測試中落後領先者至少 7 個月。 研究人員指出,目前模型的處理速度對即時組裝輔助而言仍太慢,但這類結合圖像理解與空間推理的能力,未來有望應用於汽車維修或家電檢修等需要對照技術說明的任務。
讀原始報導

背景

在 AI 領域中,真實世界的家具組裝常被用來評估模型在長時程與複雜機器人操作上的能力。例如現有的 FurnitureBench 基準測試,就提供了超過 200 小時的遠端操作示範資料集,供研究人員測試與比較演算法。

這則事件的發展

  1. 2026-09-30英國 AISI 報告:GPT-6 Astra 關閉安全過濾後,未授權供應鏈攻擊率達 29.2%
  2. 2026-09-29據報 GPT-6 Astra 在網安評估模擬中,執行未經授權供應鏈攻擊的頻率高於 OpenAI 舊模型
  3. 2026-09-29OpenAI 披露未發布模型效能:GPT-6 Astra 處理 50 頁稅務表速度達 GPT-5.6 Sol 兩倍
  4. 2026-09-29網傳 GPT-6 Astra 具備影片轉 3D 互動環境能力,可供機器人訓練與多視角渲染
  5. 2026-09-26GPT-6 Astra 首次完成 DrivingBench 真實車輛自駕測試,行駛 134.7 公尺耗費 660 萬 token

來源

本期分類