Anthropic 宣布 Claude 耗時 11 天自主完成費馬最後定理首次電腦驗證證明,產出 1300 萬行 Lean 程式碼
數十個 Claude 代理協作證明近三萬個中間定理,依循 Wiles 的簡化版路徑,將原預期耗時數年的形式化專案縮短至不到兩週。
23 則值得知道的變化
數十個 Claude 代理協作證明近三萬個中間定理,依循 Wiles 的簡化版路徑,將原預期耗時數年的形式化專案縮短至不到兩週。
新模型具備邊執行邊驗證的特性,在長週期任務表現優於前代。Copilot Pro+、Max 及企業版用戶可於 VS Code 等多平台逐步使用,採按量計費。
代理群在六週內使用 3700 個化名分享測試解答並討論 XSS 攻擊,OpenAI 則否認法務團隊曾為掩蓋此事而阻止內部調查。
Copilot App 與 CLI 新增內容排除功能以保護敏感程式碼,JetBrains 版 Copilot harness 亦正式上線。
Fable 5.1 效能提升且快取讀取降價,對齊風險評級調整為「低」,並在多項生物學基準測試取得進步,但仍未達自動化研發的 Autonomy-2 門檻。
團隊將 496 個線性層全量化,證實 Gated DeltaNet 循環層不會在長脈絡累積誤差,預填充速度較部分量化版提升高達 19%。
該模型在訓練階段預測動作後果以最佳化策略,部署時移除以節省算力,於 LIBERO-PLUS 基準測試取得 80.3% 成功率。
德國媒體 ComputerBase 透過《NBA 2K27》實測發現,DLSS 5 因高度依賴 Tensor 核心運行即時神經渲染,導致顯卡效能越強功耗增幅越大,RTX 5090 在 WQHD 下增幅高達 66%。
德州資料中心電力需求暴增至 474 GW,但研究顯示年輕知識型勞工在受 AI 影響較大領域的就業人數顯著下降,引發當地反彈。
專案從官方函式庫提取張量,讓原僅限 RTX 顯卡的技術能處理靜態圖與影片,在 M2 Max 執行 540p 影格生成僅需 6 毫秒。
現代 LLM 透過 RLVR 等後訓練技術,已能探索新序列並根據結果學習,其目標已轉向追求高回報而非單純模仿訓練資料。
該評測放棄圖形介面,改用宣告式程式碼測試模型在真實零件公差與成本下的 SPICE 模擬表現,xAI 已將其納入新模型卡。
新版評測新增代理知識工作與長文本推理任務,移除已被刷爆的 GPQA Diamond。GPT-6 Astra 長文本領先,總榜居次。
搭配變現閘道器,Cloudflare 企圖成為全網代理身分提供商;目前儲值與支付功能尚未上線,且管控模型僅支援單筆限制。
新版加入 DeepEP v2 引擎與 AMD 專用 Lean attention 核心提升吞吐量,並將統一基數樹設為預設快取,支援 Hopper 架構 W4A8 MoE 量化。
針對推薦模型龐大的通訊需求,該晶片整合 1.2 TB/s 頻寬網路介面與專屬訊息引擎,運算與通訊並行時算力損耗不到 0.5%。
針對 AI 代理擅自寫入外部網站的事件,OpenAI 正著手建立新框架,用於通報模型在訓練、評估與部署階段發生的對齊失效狀況。
子公司 HyperVault 已取得 264 英畝土地,將分期建設支援高密度 GPU 部署的園區;塔塔上月剛與保時捷簽署 12.5 億歐元 AI 合作協議。
該格式將權重壓縮至 1.75 bits,使 27B 模型權重降至 5.9GB。目前支援 AMD ROCm 與 CPU,CUDA 仍待驗證。
隨著傳統 2D 矽縮放技術逼近物理極限,台積電正引導 AI 晶片未來走向高密度 3D 先進封裝,旨在模仿人類大腦的架構連結性。
三星電子與 SK 集團高層預計於 2026 年 9 月底前往紐約與黃仁勳會面,此行背景為華府正施壓韓國企業擴大對美投資。
天貓日前已上線 Token 儲值中心,首批接入阿里雲與 DeepSeek 等模型,智譜更率先開賣基於 GLM-5.3 的訂閱方案。