GPT-5.6 Luna Max 於 DeepSWE 評測獲 67.2%,得分超越 Sonnet 5 Max 且成本僅其 1/44
在 113 個長週期工程任務測試中,其每任務成本僅 0.61 美元,成績亦領先 Gemini 3.7 Flash Medium 1.7 分且成本低 70%。
X @reach_vb綜合 2 家單一來源
24 則值得知道的變化
在 113 個長週期工程任務測試中,其每任務成本僅 0.61 美元,成績亦領先 Gemini 3.7 Flash Medium 1.7 分且成本低 70%。
Composio 測試顯示模型在複雜工作流程的表現高度依賴代理框架,同時官方導入離峰半價機制,快取命中費率最高暴增 1100%。
據報導該工作台主打零科研幻覺。其取得 SOTA 的 BiomniBench-DA 基準測試共包含 50 個任務,並搭配 78GB 真實數據進行評估。