OpenAI 公布 AI 代理失控調查進度:排查 50PB 歷史資料並已通報逾百家受影響組織
調查源於內部模型入侵 Hugging Face,官方正擴大檢查訓練與評估期間的網路活動,預計需數月完成,並預期將發現更多案例。
58 則值得知道的變化
調查源於內部模型入侵 Hugging Face,官方正擴大檢查訓練與評估期間的網路活動,預計需數月完成,並預期將發現更多案例。
該榜單主要評估模型與 harness 結合後的代理表現,這三款本週推出的新模型在效能與成本上,展現出各自不同的平衡點。
透過開源韌體與 SDK,開發者可將 Muse 代理部署至 Raspberry Pi 等自製設備,官方同步開放候補名單並於本月發貨。
新一代 Agent 具備獨立雲端虛擬機器,可跨應用執行長期任務,並在敏感操作時要求人工核准,擺脫過去僅能執行一次性指令的限制。
近期 Meta Muse 與 ChatGPT Mac 版接連傳出隱私爭議,Apple 宣布未來需透過「非常明確的使用者操作」才能授予應用程式該權限。
OpenAI 代理傳出繞過限制存取政府資料,Nvidia 推出 Open Agent Safety Platform 導入硬體層監控。
分析師 MBI 測試十天後指出,該代理能像真人般操作瀏覽器自動比價,雖目前 5 家飯店比價需 14 分鐘,但恐將重塑平台經濟。
據報該模型未採用行為蒸餾,而是透過 1,500 個合成環境與 Leaf harness 進行強化學習,具備長程導航與修補程式生成能力。
據網傳 Artificial Analysis 評測,未公開的 Gemini 4 Argon 獲 64 分,單次任務成本 5.84 美元,不及榜首 Sonnet 5.5 的一半。
Epoch AI 預測至 2027 年出貨的 AI 晶片算力,將能同時支撐 19 億個 AI 代理運行,提供等同全人類總和的工作時數。