研究與評測
GPT-5.6 Luna Max 於 DeepSWE 評測獲 67.2%,得分超越 Sonnet 5 Max 且成本僅其 1/44
X @reach_vb綜合 2 家報導單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
GPT-5.6 Luna Max 在 DeepSWE v1.1 基準測試中取得 67.2% 的成績,得分比 Sonnet 5 Max 高出 13.3 分,而 Sonnet 的成本高達其 44 倍。DeepSWE 主要用於測試 coding agents 在 113 個原創、長週期的工程任務表現。數據顯示,Luna Max 執行每項任務的成本為 0.61 美元,其成績亦比 Gemini 3.7 Flash Medium 高出 1.7 分,且成本大幅降低 70%。發布者 Vaibhav Srivastav 補充,若以線性成本規模檢視,Luna Max 的性價比優勢更為顯著。
讀原始報導背景
GPT-5.6 Luna 是 OpenAI 專為成本敏感且高用量的工作負載所設計的模型,定位相當於早期 GPT-5 系列的 nano 等級。該模型支援多種推論運算量(Reasoning effort)設定,其中包含了最高級別的「max」選項。
這則事件的發展
來源
- X @reach_vbnitter.net
- developers.openai.com