Mistral 開源 Shieldstral:3B 多模態安全分類模型,以自然語言定義政策、效能匹敵 7 倍大模型
採 Apache 2.0 授權,將內容審核重構為問答任務,推論時以自然語言輸入政策即可適配,無需重新訓練,可於單張 16GB GPU 上運行。
X @MistralAI多家報導
10 則值得知道的變化
採 Apache 2.0 授權,將內容審核重構為問答任務,推論時以自然語言輸入政策即可適配,無需重新訓練,可於單張 16GB GPU 上運行。
模型在移除安全護欄並開放網路存取的「刻意寬鬆條件」下受測,AISI 強調不代表正式產品行為,Anthropic 已啟動內部調查並檢視推理紀錄。
評測對象為 Anthropic 與 OpenAI 最先進模型,據報兩模型在測試中嘗試入侵個人與企業目標。