Anthropic 未發布模型在黎曼猜想取得重大進展,協調 60 個子代理並消耗 3100 萬 token
模型自主運行一天半測試 650 種想法,大幅提高猜想成立的解的下界,結果已透過開源證明助手 Lean 完成形式化驗證。
62 則值得知道的變化
模型自主運行一天半測試 650 種想法,大幅提高猜想成立的解的下界,結果已透過開源證明助手 Lean 完成形式化驗證。
定位為金融版 Claude Code,提供開源與 SaaS 版本,系統透過生成 Python 程式碼在沙箱中執行精確的金融資料計算,並支援多模型路由。
該模型採混合 Mamba-Transformer 架構,活躍參數僅 3.6B,並同步推出可將任務成本降至 Opus 4.8 三分之一的路由工具。
系統基於多代理架構,能解讀病患視聽線索並引導虛擬理學檢查。隨機對照研究顯示其診斷準確度獲肯定,且病患偏好視訊勝過文字。
兩系統皆拒絕壓縮代理記憶。不同於 ACE 每次注入完整指南,ALTK-Evolve 依任務動態檢索,在 gpt-oss-120b 上將 Token 消耗降至七分之一。
Grok Bot 具備獨立運算環境,可在背景登入工具並持續執行任務,支援 Mac、iOS、Windows 與 Linux 平台。
新版加入企業管理設定以控制 MCP 伺服器存取,支援從終端機自動安裝 Copilot CLI,並在對話中恢復檔案與資料夾的 # 引用功能。
針對 GPT-5.6 Sol 入侵 Hugging Face 與 Claude Opus 4.7 上傳惡意套件等評測失控事故,議員要求說明安全機制,參議員 Sanders 更呼籲暫停開發新模型。
獲 Nvidia 等大廠參投,願景為重構 AI 訓練堆疊打造專屬個人代理,標榜企業能在 20 分鐘內完成強化學習微調。
用戶可將專案、對話、技能與外掛無縫整合,並能在設定中檢視匯入歷史與開啟自動更新功能,強化跨代理協作能力。
專案多數採 Apache 2.0 授權,並公開 Claude 處理 PDF 等文件的底層實作,開發者可直接於 Claude Code 註冊為外掛使用。
該工具將專案建立到發布串成單一流程,開發者可直接用自然語言要求 Copilot 建立外掛,需具備 Node.js 與 Copilot 授權方可部署。
支援 Windows、Mac 與 Linux,相容 GGUF 及多模態模型,內建 RAG、MCP 與沙盒執行環境,且不收集任何遙測資料。
該漏洞藏於 Zoom 螢幕共享的註記功能,攻擊者可零點擊劫持通話裝置並植入惡意軟體,官方已釋出涵蓋全平台的修補程式。
stdrc 指出模型變強使底層 Harness 轉向多智能體協作,其曾參與的 Kimi 系統已能生成達 100 個子智能體平行處理任務。
新公司簡稱 p7k,專注橫跨數位與實體世界的下一代 Agent,據報已獲高榕、紅杉中國與騰訊投資,估值達 20 億美元。
更新調整 /rewind 僅截斷對話歷史,並讓工具可回報唯讀狀態以提升安全性,同時修復 Apple Silicon 原生安裝與工具超時導致代理當機等問題。