研究與評測
據報 OpenAI 推出 GPT-Red
X @btibor91未證實
據單一來源報導,OpenAI 推出內部自動化紅隊模型 GPT-Red,透過對抗式自我對弈訓練,大規模尋找提示注入漏洞。這項消息可能影響 AI 安全研究,但官方尚未證實相關內容。
讀原始報導背景
GPT-Red 是 OpenAI 內部使用的自動化紅隊系統,透過對抗式自我對弈,自動找出自家模型的漏洞,藉此改善 AI 安全性、對齊與提示注入攻擊的防禦能力。OpenAI 表示,GPT-Red 發現的漏洞已用於提升 GPT-5.6 的抗攻擊能力。