Claude Sonnet 5.5、GPT-6.1 Sol 與 Gemini 4 Argon 發布,齊聚 Coding Agent Index 排行榜前列
該榜單主要評估模型與 harness 結合後的代理表現,這三款本週推出的新模型在效能與成本上,展現出各自不同的平衡點。
X @ArtificialAnlys單一來源
58 則值得知道的變化
該榜單主要評估模型與 harness 結合後的代理表現,這三款本週推出的新模型在效能與成本上,展現出各自不同的平衡點。
旨在提供數學與程式編寫以外的長程強化學習任務,內部整合 RDKit、ADMET-AI 與 Boltz-2 等工具,挑戰超越單純化學領域的長程規劃能力。
由華為等團隊構建的開源平台推出,透過 Qwen3-0.6B 進行複雜度分類與五級模型池動態調度,結合真實反饋持續最佳化路由策略。
Reddit 社群流傳 Epoch AI 排行榜資訊,稱未公開模型 GPT-6.1 sol (max) 於前沿數學基準測試取得滿分,目前官方尚未證實。
據網傳 Artificial Analysis 評測,未公開的 Gemini 4 Argon 獲 64 分,單次任務成本 5.84 美元,不及榜首 Sonnet 5.5 的一半。