Shieldstral 會根據一個以自然語言表達的是/否問題來評估內容。一個請求包含三個部分 :
模型僅需一次前向傳遞,即可回傳一個連續的安全評分,開發者可自行設定門檻值,將其轉化為二元的安全/不安全判斷 。Mistral 建議一個查詢只對應一個政策;若需評估多項政策,則應分別進行推理呼叫 。
這種設計消除了在訓練階段就預先定義固定傷害分類法的必要性。開發者只需將任何政策轉化為一個是/否問題,Shieldstral 就能自動適應,這也使得基於不同分類法的多元安全數據集能夠整合至單一的訓練框架中 。
Shieldstral 在文字安全基準測試上,表現與體積大上 7 倍的開放防護模型相當,甚至更為優異;在多模態安全分類領域,則創下了最新的最佳紀錄 。以下數據來自 Mistral 公布的評測結果 :
文字安全分類 — F1 分數 (%)
| 基準測試 | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
多模態安全分類 — F1 分數 (%)
| 基準測試 | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
整體文字安全 F1 分數為 84.9%;多模態安全 F1 分數則為 83.8%——兩項成績均領先所有受測模型 。在文字安全方面,Shieldstral 的 84.9% 分數與 GPT-OSS-Safeguard-20B 並列,後者參數量幾乎是 Shieldstral 的 7 倍 。
| 規格 | 詳細資訊 |
|---|---|
| 參數量 | 38 億有效參數 |
| 基底模型 | Ministral-3-3B-Base-2512,內建 Pixtral 視覺編碼器 |
| 支援模態 | 文字、圖片、文字+圖片 |
| 上下文窗口 | 32K tokens(訓練時設定);理論上可支援至 256K |
| 硬體需求 | 可在單張 16GB NVIDIA GPU 上運行 |
| 支援語言 | 英文、法文、西班牙文、德文、義大利文、葡萄牙文、荷蘭文、中文、日文、韓文、阿拉伯文、俄文 |
| 輸出格式 | 單一 token 的是/否判斷,附帶連續信心評分 |
| 訓練資料 | 約 5410 萬個經策劃與生成的樣本,使用 LoRA 微調與 SLERP 檢查點合併 |
| 授權方式 | Apache 2.0——開放權重,可供商業與非商業用途 |
Mistral 目前 尚未公布 Shieldstral 在 1.0 版本之後的具體發展藍圖。該模型定位為 開放安全 AI 聯盟(Open Secure AI Alliance,與 NVIDIA 等公司共同發起)的首批成員,並作為政策自適應安全技術的基礎構件 。考量 Mistral 先前宣示要成為 AI 領域「全端玩家」的目標——從數據中心的晶片到軟體應用程式 ——未來版本的 Shieldstral 可能會擁有更大的規模、支援更多模態,或與 Mistral 的代理工具(Vibe、Forge)及企業部署方案更緊密地整合。目前尚未公布任何版本更新頻率或具體功能的時間表。
由於 Shieldstral 採用 Apache 2.0 授權的開放權重釋出,任何組織都能下載並自行託管此模型,無需與 Mistral 簽訂商業協議 。這使得內容審查的治理權回歸到組織內部:團隊可以針對特定受眾或部署情境調整危害分類法,而無需重新訓練底層模型,並可根據自身的風險承受度來設定安全評分的門檻值 。此模型適用於提示詞審查、回應審查、提示詞-回應配對分類、拒絕檢測,以及針對文字和圖片輸入的通用安全過濾 。