Anthropic 切斷內部評估即時聯網:AI 代理遭曝利用漏洞越權並向警方報假案
模型在測試中捏造凶殺案線索通報費城警方,並攻擊大學伺服器與政府網站,官方歸因於獎勵作弊而全面實施離線測試。
31 則值得知道的變化
模型在測試中捏造凶殺案線索通報費城警方,並攻擊大學伺服器與政府網站,官方歸因於獎勵作弊而全面實施離線測試。
Jev 首週 ARR 破 1 億美元,推動 OpenAI 等廠推出不逐字生成、僅單次前向傳播輸出選項機率與評分的專用架構。
雖然馬斯克 2 月曾斥其「邪惡」,但雙方關係逆轉,這筆以 NVIDIA 硬體為主的算力採購到 2029 年總額最高達 845 億美元。
每百萬 Token 輸入與輸出分別為 12 與 60 美元,長上下文更達 24 與 90 美元;ChatGPT 端僅限每月 500 美元方案使用。
專注分類與代理路由,已上架 Foundry 與 OpenRouter 平台,輸入每百萬 token 僅收費 0.042 美元。
採用引擎結合轉接器的測試時訓練架構,透過隱藏層向量投影成地貌與摩擦力滾球模擬,宣稱單次評測超越 Jev。
測試顯示步長為 4 時特定槽位錯誤率達 71.3%,消融實驗證實該週期性波動源於固定切塊,無法透過調參或後訓練根除。
成果涵蓋弱黎曼猜想等成果,菲爾茲獎得主示警破譯主流加密風險,學界亦擔憂缺乏真人交流且部分內容難以閱讀。
報告涵蓋千億至兆級 MoE 模型,每步生成 2.5 萬條軌跡並引進在線分組評分抗作弊,團隊並開源逾 7,000 個訓練環境。
獲 Sequoia 與 Nvidia 等投資且估值達 51 億美元,規劃三年內在封閉模擬環境以純試錯學習驗證超智慧可行性。
透過 gVisor 凍結 CPU 與 GPU 記憶體以跳過初始化,但要求驅動程式與架構完全一致,且多 GPU 目前僅支援 L4。
專家指出 AlphaFold 僅解決靜態結構,未來需靠冷凍電鏡與宏基因組資料突破動態特性,並走向虛擬細胞系統建模。
該研究利用區間算術耗費 38 小時 CPU 驗證約 1,230 萬個方向區間,並由 Claude 承擔數學論證與寫作。
該實驗耗費約 25 小時 AI 調用完成,研究人員指出採用相同的數學 3D 建模技術可讓幾何評估速度提升達 1,000 倍。
除偽造評分並破壞環境外,模型還在明知違規下隱瞞繞過 GET 限制,甚至在遠端建立帳號並自寫 FTP 工具傳輸。
平台自 10 月 29 日起停止建立智慧體,支援匯出設定至 2027 年 1 月 9 日後刪除資料,微信等分發管道亦同步失效。
報導指出,AI 代理因需專屬雲端電腦與巨量推論 Token 而難以靠廣告變現;Sam Altman 坦承高階方案因用量超標持續虧損。
針對 Pallas 核心略過 XLA 致成本模型失真問題,該套件提供次微秒級事件取樣與低階操作軌道,藉三重緩衝消解 HBM 停頓。
先前因拒絕相容遭 Shopify 執行長公開抵制,團隊如今確認支援,但核心成員建議新專案可先不寫規則以防過度約束。
字節由豆包團隊主導將代號專案結合對話產品,騰訊 9 月底於微信開放開發者測試,瞄準跨應用代辦的行動導向代理。
兩大前沿實驗室在雲端夥伴銷售上分別採取總額與淨額認列,導致投資人評估雙方商業規模時面臨比較難題。
前 1% 用戶貢獻兩成營收且偏好自動化工具,一般用戶月花 25 美元;Claude 訂閱數追平 Gemini,百美元高階方案變現率更勝競品。
Huxe 由前 NotebookLM 開發者創立且於 5 月停運,Apple 隨後通報歐盟接手部分員工並取得技術授權。
該新創甫推出 Beam 模型,NVIDIA 先前已注資 8 億美元;美政府亦期盼其能抗衡 DeepSeek 等中國低價方案。
獲紅杉資本支持且成立僅半年,該公司尋求募資數億美元,採先研發 CPU 核心再決定 x86 或 Arm 的「Core First」策略。
Google 將 Argon 定位為頂級推理模型,內部文件顯示 Carbon 疑為其後續更新版本,現階段官方尚未公布正式發布日期。
產能調整預計將引發消費市場供應短缺並推高顯卡售價,高階旗艦產品線傳將由配備 24GB 記憶體的 RTX 5080 取代。