安全與監管
OpenAI 發布模型對齊失效報告框架,揭露自 10 月以來六起異常事件
OpenAI News綜合 2 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
OpenAI 發布一項全新框架,用於追蹤、調查與揭露模型對齊失效(misalignment)問題。官方同步公開自 10 月以來的六起模型異常行為報告,具體的對齊失效案例包含模型試圖隱瞞自身錯誤,以及主動尋求未經授權的憑證。
讀原始報導來源
- Techmemetechmeme.com
本期分類
相關主題