安全與監管
據報 Anthropic 坦承生物武器過濾器失效近一年,1.33 億次外包商對話未經攔截
iThome單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,Anthropic 於 8 月 14 日發布的最新安全報告披露,其用於攔截化學與生物武器(CBRN)危險請求的部分安全分類器曾長期失效。
該漏洞導致在 2025 年 5 月至 2026 年 4 月期間,約 5 萬名外部承包商在提供人工回饋時,產生約 1.33 億次與模型的對話流量未經生物安全分類器攔截。Anthropic 內部調查表示,目前未發現相關請求被實際用於濫用的證據,但已針對外部承包商提高審查與管理要求。
該公司自 2025 年 5 月發布 Claude Opus 4 時啟用 AI 安全等級 3(ASL-3)防護,並在 2026 年 7 月公布 Claude Fable 5 安全措施時重申生化領域風險。為避免過於嚴格的分類器誤傷正常科研活動,目前涉及生化領域的大量 Claude Fable 5 請求會轉交由 Claude Opus 4.8 處理,未來將隨安全機制改進逐步縮小限制範圍。官方亦持續透過紅隊測試、漏洞賞金計畫與離線監測作為補充安全措施。
讀原始報導背景
Anthropic 透過其「負責任擴展政策」(RSP)制定了不同層級的 AI 安全防護標準,並已在模型部署中啟用 AI 安全等級 3(ASL-3)。針對災難性濫用風險與自主性更高的 ASL-4 及 ASL-5+ 等級,目前則因距離現有系統技術尚遠而尚未明確定義。
這則事件的發展
- 2026-08-15據報 Anthropic Q2 營收突破 115 億美元,年增 14 倍並實現正向調整後營業利益
- 2026-08-15Ramp 調查:Anthropic 企業採用率 43.5% 連四月領先 OpenAI,高階模型 Fable 5 與 GPT-5.6 遇價格瓶頸
- 2026-08-13據報 Anthropic 擬以 60 億美元收購 AI 新創 Decart
- 2026-08-09Anthropic 開 85 萬美元年薪招募工程師教 Claude 設計晶片,薪資高於實體 ASIC 開發人員
- 2026-08-06Anthropic 首度證實籌組自研晶片團隊,開出最高 48.5 萬美元年薪招募工程師
來源
本期分類