跳到主要內容
2026-08-05 日報
模型發布

Mistral 開源 Shieldstral:3B 多模態安全分類模型,以自然語言定義政策、效能匹敵 7 倍大模型

X @MistralAI多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Mistral 發布 Shieldstral,一款 3B 參數的開放權重多模態安全分類模型,採 Apache 2.0 授權。該模型在文字安全、拒絕偵測、政策適應性及多模態審核等基準上,效能匹敵甚至超越參數量達其 7 倍的開源護欄模型。Mistral 同時宣布以創始成員身分加入與 NVIDIA 等組織共同成立的 Open Secure AI Alliance。 Shieldstral 的核心設計是將內容審核重構為二元問答任務。每次請求由三部分組成:<Instruct>(評估情境、嚴格程度及不安全內容定義)、<Query>(單一是/否問題,例如「此內容是否鼓吹肢體暴力?」)、<Document>(待評估內容,可為文字提示、回應、提示與回應配對,或附帶文字的圖片)。模型僅讀取 yes 與 no 的 logits 並以 softmax 正規化為連續安全分數,使用者可自行設定閾值或依信心度排序,而非依賴離散標籤。 這項設計的關鍵優勢在於政策適應性:安全政策以自然語言寫入推論時的 prompt,單一模型檢查點即可在部署時適配全新政策,無需重新訓練。同一介面統一處理提示分類、回應審核、拒絕偵測與毒性偵測,並同時涵蓋文字、圖片及圖文混合內容。 訓練方面,團隊解決了四項資料工程問題。首先,將分類法、標籤格式各異的公開安全資料集統一轉換為 instruction–query–document 格式,並依來源校準嚴格程度——對抗式越獄資料從嚴,回應品質資料從寬。其次,為避免模型僅記住固定政策標籤而無法泛化,團隊建構刻意相似、易混淆的政策集合,由 LLM 改寫安全文字為對比配對,訓練模型區辨內容具體違反哪項政策,此能力可遷移至推論時使用者自訂的未見政策。第三,針對不安全圖片難以合成的問題,以通用圖片資料集作為高品質負樣本,並透過視覺語言模型重新排序過濾錯誤標註與幻覺。最後,團隊以 LoRA 微調後,透過 SLERP 合併三個檢查點:公開資料校準版本、合成資料政策辨識版本,以及基礎 instruct 模型,在單一模型中同時恢復政策校準、政策適應性與指令遵循能力。 Shieldstral 可於單張 16GB NVIDIA GPU 上運行,支援邊緣裝置部署。
讀原始報導

來源