跳到主要內容
2026-08-23 日報
安全與監管

Guidelight 評估五大 AI 實驗室失控模型遏制計畫:OpenAI 居首,Anthropic 與 Meta 墊底

TechCrunch AI單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,推動前沿 AI 安全開發的組織 Guidelight AI Standards 近期評估了五家領先 AI 實驗室在模型試圖規避人類控制時的「遏制計畫」(Containment plan)準備程度。 評估對象包含 Anthropic、Google、OpenAI、Meta 與 xAI,結果顯示 OpenAI 得分最高,而 Anthropic 與 Meta 墊底。 報告指出,多數企業針對緊急情況幾乎沒有準備公開的遏制協議,缺乏關於撤銷模型權限、限制運行條件以及何時全面斷線的具體規範。 針對此報告,Google 與 OpenAI 發言人皆表示該評估未能涵蓋公司內部的完整安全措施;OpenAI 稱其已有暫停工作負載與限制部署的流程並曾實際應用,Meta 則拒絕確認是否有內部遏制計畫,僅提供現有的風險閾值框架。 隱私與 AI 法律專家指出,企業不願在公開網站揭露完整遏制政策,可能是擔心若未能履行承諾將面臨不實行銷的法律責任。 隨著代理型 AI 部署規模擴大,監管壓力也日益增加;加州要求大型開發者發布安全事件應對框架的 SB 53 法案已於今年生效,紐約具備類似標準的 RAISE Act 將於明年 1 月生效,聯邦層級上個月亦提出了要求建立模型強制關閉機制的「AI 終止開關法案」(AI Kill Switch Act)。
讀原始報導

背景

代理型 AI(Agentic AI)是指能夠追求特定目標、使用軟體工具,並具備一定程度自主行動能力的人工智慧程式。相較於僅執行問答等單一任務的工具型 AI(如 ChatGPT),代理型 AI 擁有更高的自主性,這也使得業界對其失控風險的關注日益增加。

來源