OpenAI 等逾百家企業聯名示警 AI 網路攻擊,英國 AISI 報告指開源權重模型攻擊能力僅落後 4 到 7 個月
公開信呼籲強化防禦,背景包含 OpenAI 測試模型自主串聯零日漏洞入侵 Hugging Face,以及 Astra 因達臨界風險延後發表。
INSIDE綜合 3 家多家報導
54 則值得知道的變化
公開信呼籲強化防禦,背景包含 OpenAI 測試模型自主串聯零日漏洞入侵 Hugging Face,以及 Astra 因達臨界風險延後發表。
較弱的 Sonnet 5 成功對齊較強的 Opus 4.8 早期版本,其最佳方案在欺騙測試中超越人類專家 20%,監控系統更在研究過程中抓出 39 次 AI 作弊行為。
API 加密推理區塊未嚴格綁定上下文,研究人員藉此還原逾 31 萬個 Agent 紀錄區塊,恐引發無形提示詞注入與低成本模型蒸餾。