跳到主要內容
2026-08-18 日報
模型發布

Mistral AI 發布 3B 開放權重多模態安全分類器 Shieldstral,效能超越 7 倍大模型

AI 科技評論單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Mistral AI 正式發布 3B 參數的開放權重(open-weights)多模態安全分類器 Shieldstral,可透過統一介面審核文本、圖片及圖文混合內容。該模型打破傳統固定風險標籤的限制,支援在推論階段輸入自然語言自訂審核規則,將任務轉化為由 <Instruct>(審核場景與尺度)、<Query>(具體問題)與 <Document>(待審內容)組成的 Yes/No 判斷題,並輸出 0 至 1 的連續分數供業務端設定閾值。訓練階段採用對比式訓練,建立包含 11 個上層與 73 個葉子類別的體系,並生成約 440 萬條合成對比文本樣本,使其在細粒度規則驗證集上的 F1 分數從 61.1% 提升至 84.4%。視覺方面,團隊針對風險類別生成約 2000 種不同措辭的審核問題(含 30% 反向問法),並結合違規、乾淨與通用圖像,經視覺語言重排序模型過濾後,構建約 450 萬條多模態訓練資料。評測結果顯示,Shieldstral 效能可超越體積達 7 倍的模型;在文本提示詞審核 HarmBench 測試中 F1 達 99.4%,優於 GPT-OSS-Safeguard-20B 與 LlamaGuard-4-12B;WildGuardTest F1 達 88.1%。在多模態場景 VLGuard 基準測試中,F1 達 97.7% 位列榜首,大幅領先 OmniGuard-7B 與 LlavaGuard-7B;UnsafeBench F1 則達 81.8%,領先第二名近 10 個百分點。
讀原始報導

背景

Shieldstral 是由 Mistral AI 推出的 3B 多模態安全分類器,旨在透過單一介面處理文字與圖像的內容審核。該模型將傳統的固定標籤分類轉化為二元問答任務,讓開發者能在推理階段以自然語言動態調整安全規則。

這則事件的發展

  1. 2026-08-05Mistral 開源 Shieldstral:3B 多模態安全分類模型,以自然語言定義政策、效能匹敵 7 倍大模型

來源