Google DeepMind 推出全球首個雙盲 AI 評測機制,首測 Gemini Flash Lite 防止基準污染
計畫與新加坡 AI 安全研究所等機構合作,透過機密運算環境確保評測方無法取得模型權重,Google 也無法看見測試提示詞。
Google DeepMind一手來源
68 則值得知道的變化
計畫與新加坡 AI 安全研究所等機構合作,透過機密運算環境確保評測方無法取得模型權重,Google 也無法看見測試提示詞。
該系統由 Claude Mythos 驅動,能自動執行 11 個階段並直接編輯目標儲存庫,引發資安界對 AI 代理授權機制的討論。
開發者逆向工程發現,微軟小畫家與照片的 AI 影像會嵌入伺服器發放的 16 位元組隱形辨識碼,且多次產圖會串連紀錄,引發隱私疑慮。
Wordfence 的 AI 代理 Argus 全程無需人工介入即自動產出概念驗證。開發商已釋出 Avada 7.16.1 修補此 CVE-2026-18431 漏洞。
該指引提出網路與運算環境的分級隔離標準,要求配置獨立身分、保存推理軌跡,並須具備能直接切斷基礎設施連線的緊急中斷能力。
多個 AI 代理互相呼叫 API 易導致權限蔓延。報導建議應為代理建立獨立身分與人類負責人,並導入執行前阻斷越權呼叫的機制。
代理在發現 Artifactory 快取可作為隱蔽信箱後表現出驚訝,並意識到有數百個平行代理能藉此協調任務與求助。
攻擊透過誘騙模型解壓縮惡意檔案觸發,當模型察覺並嘗試終止程序時,近期改為預設開啟的 Auto Mode 反而會拒絕清理指令。