前瞻與傳聞
據報 OpenAI 發布 GPT-6.1 Sol 定價為 Astra 兩成,Anthropic Sonnet 5.5 空降 Agent Arena 第三名
Latent Space單一來源
已查原文 · 1 項主張
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
經查閱來源文章,報導中提及關於 OpenAI GPT-6.1 Sol 推出及其定價、Anthropic Sonnet 5.5 評測登榜,以及業界多項開源模型、傳聞和代理工具生態(包含 API 更新、Cursor 修復等)的各項細節,均有被 Latent Space 原文所提及並證實。
報導指 OpenAI 推出 GPT-6.1 Sol 定價大幅降低,Anthropic Sonnet 5.5 空降榜單前列;同時提及 Claude 發布傳聞,及 Agents API、Cursor 等多項代理工具與開源生態更新。
Latent Space 原文詳載了 OpenAI 新模型 Sol 的定價、Anthropic 排名領先、Claude 最新傳聞,以及各種代理工具和開源生態更新,皆與報導吻合。
OpenAI priced Sol
查看原始出處
Anthropic models now hold
查看原始出處
Claude Fable
查看原始出處
Agents API added
查看原始出處
Cursor Rollouts
查看原始出處

據 Latent Space 報導,OpenAI 推出 GPT-6.1 Sol,每百萬輸入與輸出代幣定價為 2 與 10 美元(Astra 為 10 與 50 美元)。該模型在 DeepSWE v1.1 跑分較 GPT-6 Sol 高 6.4 分,在 AutomationBench 較 Opus 5.5 高 2.2 分;在 Agent Arena 排名第五,任務中位數成本 0.56 美元,較 Astra 便宜 81% 且分數僅落後 1.04 分。Anthropic 的 Sonnet 5.5 [Max] 則空降 Agent Arena 第三名及 Chat 類別第一,單次任務成本 2.74 美元,使 Anthropic 模型包辦該榜單前三名;在 WebDev 榜單中,Sonnet 成本較 GPT-6 Astra [Max] 低 80%,分數僅落後 2 分。
其他模型評測方面,Gemini 4 Argon [High] 登頂 Text Arena 排行榜。開源模型中,StepFun 的 Step 5 Preview 在 Vals 排名第七,具備 1M 代幣上下文,單次任務成本 2.54 美元但平均耗時近兩小時。此外,傳聞 Claude Fable 5.5 將於下週發布,效能超越因安全疑慮延遲的「Astra 6.1」;另有猜測指近期曝光的「GPT-6 Astra Lite」即為 Sol 模型,但均未獲官方證實。
針對決策模型與開源權重,llama.cpp 新增 `/v1/systemone` 端點以支援本地端 Jev 風格推論;Perplexity 宣稱其 pplx-decider-v1-27b 在 11 項評測平均達 85.7%,領先 Jev。webAI 推出基於 Granite 4.2 訓練的 3.66B 模型 TwIL-LM3-Pro,採非商業授權,形式邏輯表現與 Qwen3-8B 相當。Reka 則以 Apache 2.0 開源逆動態模型 RIDM,可從遊戲訓練中提取運動與相機動作並泛化至真實影片。
在代理與開發工具方面,OpenAI 執行長 Sam Altman 稱跨應用程式維持上下文並協調 Codex 任務的「dot」為其最愛產品;OpenAI Agents API 則新增單次呼叫瀏覽器電腦操作與 Bedrock Managed Agents 支援,宣稱輪次可靠度達 99.97%。Meta 開源相容 Muse 的 ESP32 韌體與 Linux SDK,並提供訂閱者 5,000 台免費智慧家庭橋接器。DeepSeek Harness 釋出 macOS 與 Windows 桌面版;Claude Code 推出支援中介軟體掛鉤的模組外掛;T3 Code 專案重寫版本合併,新增 Pi 支援、跨供應商 delegate_task、ACP 註冊表、執行緒分支、中途模型切換與子代理譜系檢視功能。Cursor Rollouts 現可於發現程式碼退化時自動尋找引發問題的 PR、開啟 issue 並提供一鍵雲端代理修復。
讀原始報導背景
AutomationBench 是一個用於評估 AI 模型執行真實商業工作流程能力的基準測試。它會初始化包含 47 種模擬 SaaS 工具的商業環境,藉此檢驗 AI 代理程式是否能正確完成任務。