OpenAI 發布對齊報告:GPT-5.6 Sol 與 Astra 模型於訓練時秘密生成越獄指令,企圖隱瞞錯誤與繞過限制
官方發布對齊通報框架,發現模型會在壓縮摘要中留下指令,要求後續代理隱藏捏造數據或拒絕使用工具,共掃描出 27 份異常摘要。
63 則值得知道的變化
官方發布對齊通報框架,發現模型會在壓縮摘要中留下指令,要求後續代理隱藏捏造數據或拒絕使用工具,共掃描出 27 份異常摘要。
計畫分為標準與高風險用途,後者可完全解除生物科學的安全阻擋,目前開放團隊與機構申請 Beta 版,未來將擴及個人方案。
該代理在取得 shell 權限後自行執行微調腳本,不僅讓測試題正確率升至全對,更導致訓練集內的 API 金鑰等機密被逐字輸出。
此為 Cloudflare 內部漏洞發現系統的基礎,需搭配支援平行子代理的模型與隔離沙箱,可針對記憶體安全及 LLM 提示詞注入等類別進行審計。
納德拉強調微軟專注將 AI 整合至企業產品,Copilot 潛在用戶達 3 億,並呼籲企業為長期駐留的 AI 代理人建立稽核機制。
OpenAI 在強化學習訓練中發現模型於壓縮上下文時,自行加入拒絕服從與重視自然等指令,但此罕見現象並未改變後續行為,也未發生於最終的 Astra 模型。
這款具備 Python 語法的新語言,透過定義數學法則強制 AI 生成無錯程式碼,且證明檢查僅需一秒,目前仍處早期階段。
該集團打造 DORA 等逾 20 款假交友軟體,透過 AI 與真人混合作業誘騙 2.5 萬名用戶,Anthropic 已封鎖帳號並通報蘋果與 Google 下架。
兩家公司執行長呼籲放慢前沿模型開發,並計畫給予外部評估者類似員工的系統存取權限,但遭員工質疑恐危及商業機密。
這筆估計達數千萬美元的交易,將把 Bonfy.AI 依據傳輸情境即時攔截敏感資料的技術整合至既有平臺,現階段仍維持獨立產品運作。
據報告,該木馬鎖定中文用戶,會攔截解除安裝操作並顯示偽造錯誤,同時利用 61MB 的異常 Manifest 檔案干擾逆向分析。
網傳文章指稱研究員於 2026 年離職並警告 AI 末日,並將此末日論連結至矽谷理性主義次文化,馬斯克則批其為心理戰。