跳到主要內容
2026-08-17 日報
研究與評測

GPT-5.6 Luna Max 於 DeepSWE 評測獲 67.2%,得分超越 Sonnet 5 Max 且成本僅其 1/44

X @reach_vb綜合 2 家報導單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

GPT-5.6 Luna Max 在 DeepSWE v1.1 基準測試中取得 67.2% 的成績,得分比 Sonnet 5 Max 高出 13.3 分,而 Sonnet 的成本高達其 44 倍。DeepSWE 主要用於測試 coding agents 在 113 個原創、長週期的工程任務表現。數據顯示,Luna Max 執行每項任務的成本為 0.61 美元,其成績亦比 Gemini 3.7 Flash Medium 高出 1.7 分,且成本大幅降低 70%。發布者 Vaibhav Srivastav 補充,若以線性成本規模檢視,Luna Max 的性價比優勢更為顯著。
讀原始報導

背景

GPT-5.6 Luna 是 OpenAI 專為成本敏感且高用量的工作負載所設計的模型,定位相當於早期 GPT-5 系列的 nano 等級。該模型支援多種推論運算量(Reasoning effort)設定,其中包含了最高級別的「max」選項。

這則事件的發展

  1. 2026-08-13據報神經外科醫師使用 GPT-5.6 驅動的 ChatGPT,成功證明數值線性代數難題 Crouzeix 猜想

來源