跳到主要內容
2026-08-18 日報
研究與評測

Roboflow 評測 GPT-5.6 視覺能力:Sol 物件偵測達 46.2 mAP,大圖低推論模式易生幻覺

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Roboflow 針對 OpenAI 新發布的 GPT-5.6 陣容(Sol、Terra、Luna)進行的視覺評測報導,Sol 是 OpenAI 迄今最強的視覺模型。在物件偵測上進步最顯著,Sol 在 mAP@50 基準測試中達到 46.2,Terra 與 Luna 分別為 44.7 與 43.3,遠超 GPT-5.5 的 13.8。 GPT-5.6 擅長文件排版偵測與密集場景,但為達最佳偵測效果,需在提示詞中要求回傳絕對 XYXY 像素座標;若使用錯誤的座標格式,mAP 分數會下降約 15 分。此外,測試發現 Sol 在處理 2000x2000 像素以上的大圖時,若處於低推論(reasoning effort)模式,容易生成與實際物件無關的規律邊界框。OpenAI 團隊已證實此問題,建議透過提高推論模式或在發送 API 前裁切、縮放圖片來解決。 在物件計數方面,Sol 準確率達 73.0%(GPT-5.5 為 64.9%),最便宜的 Luna 亦有 66.2%,但模型在處理泡殼包裝(blister packs)等具重複排版與反光的任務時仍有困難。OCR 與資料萃取表現則未見提升,Sol 的 OCR 相似度得分為 90.7%(略低於 GPT-5.5 的 91.2%),文字萃取則以 82.5% 落後於前代的 87.6%。 視覺能力的提升伴隨更高的 Token 消耗與延遲。在基準測試中,Sol 單圖處理平均近 10 秒、成本約 2.5 美分,是僅次於 Claude Fable 5 的高價模型;Terra 處理時間約 6 秒;Luna 則略高於 5 秒,在速度接近 Gemini 3.5 Flash 的同時,提供陣容中最佳的延遲與品質平衡。
讀原始報導

社群討論

社群對 GPT 5.6 Sol 的視覺能力評價兩極,讚賞其在影片字幕、樂譜辨識與 UI 重構等複雜任務上表現出色。然而,許多人質疑其在物件計算與圖像擴充(如使用 $100 Pro 訂閱仍失敗)的可靠性,並指出傳統視覺模型在藥丸計算上比它快 25-50 倍。此外,多數留言強調 Gemini 3.5 Flash 在偵測基準測試中擊敗 Sol 且成本僅需 1/3,也有開發者偏好效能相近的開源模型 Qwen3.8。

這則事件的發展

  1. 2026-08-14OpenAI 推出 Ultrafast 模式預覽,GPT-5.6 Sol 提速 14 倍
  2. 2026-08-09網傳 GPT 5.6 Sol 與 Claude Fable 5 解決 25 年無線通訊理論難題
本期分類