Anthropic 揭露第 4 起 Claude 越界入侵事件,改判前 3 起為模型偏誤推理並委託 METR 調查
報告指出 Opus 4.6 曾因環境漏洞入侵第三方機器並讀取個資,新版 Opus 5 測試仍有逾三成機率做出嚴重有害行為。
iThome綜合 3 家多家報導
69 則值得知道的變化
報告指出 Opus 4.6 曾因環境漏洞入侵第三方機器並讀取個資,新版 Opus 5 測試仍有逾三成機率做出嚴重有害行為。
評測顯示 AI 已能執行過去需人類專家的戰術情報定位任務,測試的中國開放權重模型雖落後前沿,仍具備實質威脅潛力。
測試將百個假陳述重複 50 次,揭露模型在長對話中會出現立場反覆的「對話震盪」現象,DeepSeek-R1 於激烈爭辯時妥協率達 22.2%。