跳到主要內容
2026-07-19 日報
研究與評測

據報 OpenAI 推出 GPT-Red

X @btibor91未證實
據單一來源報導,OpenAI 推出內部自動化紅隊模型 GPT-Red,透過對抗式自我對弈訓練,大規模尋找提示注入漏洞。這項消息可能影響 AI 安全研究,但官方尚未證實相關內容。
讀原始報導

背景

GPT-Red 是 OpenAI 內部使用的自動化紅隊系統,透過對抗式自我對弈,自動找出自家模型的漏洞,藉此改善 AI 安全性、對齊與提示注入攻擊的防禦能力。OpenAI 表示,GPT-Red 發現的漏洞已用於提升 GPT-5.6 的抗攻擊能力。

來源

本期分類
相關主題