Claude Opus 5.5 (High) 獲 1509 分登頂 Text Arena,Anthropic 包辦前六名
模型於 2026 年 7 月上線,開放 Pro 與 Max 方案用戶使用。其評分較 Opus 5 提升 18 分,並以 4 分之差領先位居第二的 Opus 4.6。
34 則值得知道的變化
模型於 2026 年 7 月上線,開放 Pro 與 Max 方案用戶使用。其評分較 Opus 5 提升 18 分,並以 4 分之差領先位居第二的 Opus 4.6。
該純 C 語言框架針對 MoE 架構設計,將常駐權重留存記憶體並動態從 SSD 讀取路由專家,GLM-5.2 在 128GB 記憶體下速度約 1.8 token/s。
測試要求模型比對照片與 PDF 說明書找出錯誤。GPT-6 Astra 每張照片耗時 3 分鐘,擊敗 Claude Fable 5.1 的 70%。
採 Apache 2.0 授權,將檔案選擇交由確定性邏輯處理以降低消耗。專家指出其召回率上限僅 20%,且難以挖掘跨檔案架構問題。
模型接受狀態、問題 schema 與圖片輸入,透過結構化候選評分機制,無須呼叫生成函數即可返回 JSON 答案。
成立僅三個月的 Simate 已獲數億元人民幣融資,其模型主打 4D 物理感知與分層時序記憶,以 33.95 分位居榜首,並開放 AI 驅動平台供高校內測。
針對現有 VLA 模型缺乏物理感知的局限,新模型透過三大模組即時預判摩擦與重心變化,配套的 RoboTwin-Phys 評測基準與資料集已全面開源。
該模型在困難基準測試中開啟擴展推理後得分為 68.9%,雖不及 Jev 的 74.1%,但為該領域提供了可本機部署的開源新選擇。
Reddit 社群流傳 Swift 1.5 27b 模型發布消息,發文者稱其為速度更快的 Qwen 模型,但目前尚無具體的實測數據與官方細節。
總參數 14B,深度圖測試擊敗 Depth Anything V2。目前無 GGUF 格式且為非商業授權,官方僅在 80GB A800 驗證過部署。
由 vLLM 團隊創立的 Inferact 透過 Pallas 語言整合推論程式,搭配 DeepSeek 框架,在 16 塊 TPU 上跑出每秒 709 token 的成績。
該架構借鑒 Apache Spark,由 Worker 模型平行處理局部上下文,再由 GRPO 訓練的 Driver 模型統整證據,在 LongBench v2 評測提升 9.8 分。
系統透過自動分析執行軌跡,找出合併動作與壓縮上下文等四項機制,在 EdgeBench 測試中保留 93.7% 效能,每小時最高可省 13.5 美元。
該方案無需微調,透過預填提示詞與 vLLM 讀取特定 token 機率,使語言模型達到與 Jev 相當的決策速度與準確度,並額外支援圖像輸入。
蘋果公開各裝置對應的模型規模,M5 Ultra Mac Studio 單機可承載 4,800 億參數,展現統一記憶體架構的推理優勢。
系統結合 Claude Sonnet 與 Opus,透過 MCP 獲取數據並在隔離環境修改程式碼,平均耗時 13.8 分鐘,成功為 90% 的評估任務生成可用 PR。
麥肯錫調查指出,約五分之一企業已面臨 AI 開支帶來的營運壓力,特別是軟體開發團隊自動化寫程式的 token 消耗尤為顯著。
受 AI 基礎設施需求帶動,Nearline HDD 交期一度拉長至 52 周,摩根大通預估未來三年 HBM 需求年複合成長率將達 63%。
據 Reddit 社群流傳消息,部分 Claude Code 使用者可領取最高達 250 美元的免費額度,官方尚未證實此活動細節。
該最佳化改良 n-gram 快取機制,使記憶體佔用減少 2.6 倍,並在整合 Daniel Lemire 的 PR 後達成此效能突破。
在未更新模型與策略下,每週對 AI 代理輸入相同提示詞,數週後代理逐漸遺漏限制條件,最終直接給出違反安全策略的答案。
因零件精密且對位困難,目前產能遠低於每週兩萬台目標。V3 版尚未配備新型感測手套,未來初期擬採出租模式以蒐集訓練資料。
原本限時提升的 60 美元額度現已在 OpenCode Go 標示為永久有效,該模型在平台近期兩百萬級使用量中佔比約 13%,位居第一。
受 Recall 功能資安爭議影響,微軟與高通高層證實近期產品已悄悄移除該行銷術語,未來僅保留 45 TOPS NPU 等硬體規格要求而不再冠名。
美國與中國同意針對人工智慧風險建立溝通管道,並設立專屬的 AI 事件熱線,此舉被外界比喻為冷戰時期的「紅色電話」。
此舉削弱了聯合國為監管致命自主武器所推動的里程碑式努力,兩國在談判中降低了一系列原訂的防護措施標準。
二月飛彈攻擊造成逾 150 人死亡,聯合國指其恐構成戰爭罪;報導稱 Lonsdale 旗下創投在國防科技領域握有 60 億美元投資。
計畫直接承租阿波羅全球管理旗下開發商的園區以部署 Google TPU,並正探討由 Google 為此項目提供信用擔保的可能性。
獲日本政府補助 10 億美元,預計 2029 年將 300mm 晶圓產能提升至每月 4.5 萬片,並為後續導入共同封裝光學鋪路。
OpenAI 正在開發名為「O」的常駐 AI 助理,其底層採用 Astra 變體模型 Aeon,該模型專為執行長時間任務而設計。
Reddit 流出未經證實的 OpenAI DevDay 消息,稱模型生成速度高達 750 tokens/s,且聊天介面將出現 GPT-6 Sol。
「SciUniverse Part 2」指出該模型能在真實環境完成藥物化學實驗,並利用 LC-MS 測量數據確認目標分子確實存在。
據社群消息指出,美國 FTC 主席提出針對 AI 代理(Agents)的監管方向,建議 AI 開發者必須為其模型驅動的代理行為承擔相關責任。
據 Reddit 社群未經證實的傳聞,Sonnet 5.5 獲發布前升級並預計於週一推出,爆料更宣稱其效能已超越 GPT-6 Sol。