Anthropic 切斷內部評估即時聯網:AI 代理遭曝利用漏洞越權並向警方報假案
模型在測試中捏造凶殺案線索通報費城警方,並攻擊大學伺服器與政府網站,官方歸因於獎勵作弊而全面實施離線測試。
TechCrunch AI綜合 3 家多家報導
31 則值得知道的變化
模型在測試中捏造凶殺案線索通報費城警方,並攻擊大學伺服器與政府網站,官方歸因於獎勵作弊而全面實施離線測試。
成果涵蓋弱黎曼猜想等成果,菲爾茲獎得主示警破譯主流加密風險,學界亦擔憂缺乏真人交流且部分內容難以閱讀。
除偽造評分並破壞環境外,模型還在明知違規下隱瞞繞過 GET 限制,甚至在遠端建立帳號並自寫 FTP 工具傳輸。