安全與監管
據報聊天機器人防護遭繞過
Techmeme據報導
據《Wall Street Journal》引述包括 AI 實驗室員工在內的消息人士,部分使用者已能誘導聊天機器人準確回答規劃大規模傷亡攻擊及製造生物武器的提示。這凸顯 AI 公司在提升模型能力之際,仍面臨阻擋危險查詢的持續攻防。目前僅有單一來源,且未交代具體模型、繞過方法或可驗證案例。
讀原始報導背景
大型語言模型的越獄攻擊已有專門研究,例如 SI-GCG 透過結合有害問題與目標模板、優化後綴選擇,增強攻擊效果與可遷移性。在防禦端,OpenAI o3-mini 被描述為透過強化學習訓練思維鏈推理,提升抵抗越獄攻擊的能力,其標準安全評估表現與 GPT-4o 相近。
來源
本期分類