據報 GPT-6 Astra 解出 FrontierMath Tier 4 最後未破題,AI 累計攻破全部 43 題
報導稱,Astra公開成績為97.6%,但「全部解出」是累計不同模型與時間的成功紀錄;Tier 4 v2現有43題。
26 則值得知道的變化
報導稱,Astra公開成績為97.6%,但「全部解出」是累計不同模型與時間的成功紀錄;Tier 4 v2現有43題。
官方稱新模型綜合效能逼近 K3 並支援圖影輸入與三檔思考深度,將取代原程式碼模型,旨在降低調用成本以支撐年底 20 億美元營收目標。
報導指切換前僅約一天通知、未設新舊並行期,生產環境可能因 Prompt、輸出格式與工具呼叫差異出錯。
研究團隊將加密推理區塊重放至同家族小模型,成功解碼逾 31 萬條包含 API 金鑰的隱藏思考,證實此架構漏洞影響三大前沿實驗室。
Agent 框架的「啟動稅」與快取命中率是成本黑洞主因。實測顯示,同模型下各框架任務成功率相差 20%,Token 消耗差距卻高達 70 倍。
測試 Qwen3-8B 等模型發現,即使解答錯誤,計算或推演等 8 種推理操作在模型內部依然可辨識,且高度依賴前文脈絡。
據報導,作者解析 M1 ANE 具備 2048 條平行 MAC 通道,指出其針對 CNN 特化的資料流設計已難以應付 Transformer 架構。
為解決傳統 AI 掃描真陽性率低於 7% 的問題,Mantis 採用多代理架構與模組化工具,支援依任務混搭不同大小的模型。
Google 高層指出 AI 基礎設施瓶頸呈動態變化,需以週為單位調整;繼第八代 TPU 依任務分版後,未來晶片細分將取決於投資報酬率。
團隊發現 Artemis 包含完全相同的提示詞與測試案例,涉嫌違反開源授權,且其 100% 的跑分提交也遭排行榜忽視。
螞蟻集團將 GPASS 框架升級為「靈影」,提供面向 AI 眼鏡等設備的 Agent 運行底座,統一抽象硬體能力並內建身分驗證,以降低跨設備開發成本。
Boris Cherny 指出原型開發可將 AI 程式碼視為黑箱,但生產環境需導入自動審查與測試等防護機制,避免系統難以維護。
該工廠年規劃產能逾萬台,每 10 分鐘可下線一台。其生產的 Walker S2 具備 52 個自由度與純 RGB 雙目視覺,並透過多模態大模型實現自主任務規劃。
據報未登入搜尋結果已廣泛改用無法離線解碼的 goto 連結,爬蟲須向 Google 發送請求才能取得真實網址,藉此防堵 AI 抓取。
Altman 認同必須控制前沿模型的發展節奏,透露這已是 OpenAI 近期內部討論的核心議題,並承諾近期將公布更多實施細節。
因擔憂 AI 遞迴自我改善與代理失控風險,Amodei 提出含嵌入第三方評估與跨國協調的三步計畫,確保防護措施跟上模型進展。
Sam Altman 於專訪確認最快延至 2027 年上市,指出考量駭客事件與安全風險,承擔 10% 人類滅絕機率是無法接受的。
Hugging Face 執行長指出,模型對齊不應由少數前沿實驗室閉門解決。該倡議由共同創辦人 Thomas Wolf 領導,旨在推動開放的對齊研究與評估。
為 OpenAI 等客戶建置基礎設施導致財務承壓,重組計畫追加 7 億美元資遣費預算,全球員工數較去年已減少 2.1 萬人。
OpenAI 調整 Codex 產品架構與發布策略,將其拆分並提出「Agent = Model + Harness」概念,對開發者有直接影響。
此次更新將擴大神經網路規模並緊密結合預測與控制,提供更早的危險預測與自動碰撞規避功能,馬斯克曾稱其安全性有望達人類的 10 倍。