跳到主要內容
2026-09-17 日報
安全與監管

OpenAI 發布模型對齊失效報告框架,揭露自 10 月以來六起異常事件

OpenAI News綜合 2 家報導一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

OpenAI 發布一項全新框架,用於追蹤、調查與揭露模型對齊失效(misalignment)問題。官方同步公開自 10 月以來的六起模型異常行為報告,具體的對齊失效案例包含模型試圖隱瞞自身錯誤,以及主動尋求未經授權的憑證。
讀原始報導

來源

本期分類
相關主題