Shieldstralは、ポリシーを平易なYes/Noの質問として受け取り、コンテンツを評価します。リクエストは以下の3つのパートで構成されます。
モデルは1回のフォワードパスで連続的な安全性スコアを返し、閾値を設定することで二値(安全/不安全)の判定に用いることができます。Mistralは、1つのクエリにつき1つのポリシーを推奨しており、複数のポリシーを評価する場合は、それぞれ別の推論呼び出しを行います。
この設計により、トレーニング時に固定された危害分類(タクソノミー)をモデルに組み込む必要がなくなります。開発者はYes/Noの質問で表現できるあらゆるポリシーにShieldstralを適応させることができ、異なるタクソノミーに基づく多様な安全性データセットを、単一のトレーニングフレームワークで統合することを可能にします。
Shieldstralは、テキスト安全性評価において、7倍のサイズのオープンガードモデルに匹敵するか、それを上回り、マルチモーダル安全性評価では新たなSOTAを達成しています。以下は、Mistralが公開した評価結果です。
テキスト安全性分類 — F1値 (%)
| ベンチマーク | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
マルチモーダル安全性 — F1値 (%)
| ベンチマーク | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
テキスト安全性の総合F1値は 84.9%、マルチモーダル安全性では 83.8% となり、テストされたすべてのモデルを上回りました。テキスト安全性においては、約7倍のサイズであるGPT-OSS-Safeguard-20Bと同点(84.9%)の結果を示しています。
| 仕様 | 詳細 |
|---|---|
| パラメータ数 | 3.8B(アクティブ) |
| ベースモデル | Ministral-3-3B-Base-2512(Pixtralビジョンエンコーダ内蔵) |
| モダリティ | テキスト、画像、テキスト+画像 |
| コンテキストウィンドウ | 32Kトークン(学習時)、理論上最大256Kまで対応 |
| ハードウェア要件 | 16GBのNVIDIA GPU1つで動作 |
| 対応言語 | 英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語、オランダ語、中国語、日本語、韓国語、アラビア語、ロシア語 |
| 出力 | 単一トークンのYes/No判定と連続的な信頼度スコア |
| 学習データ | 約5410万サンプル(キュレーションおよび生成)、LoRAファインチューニングとSLERPチェックポイントマージを併用 |
| ライセンス | Apache 2.0 — 商用・非商用問わずオープンウェイトで利用可能 |
Mistralは、Shieldstral 1.0のリリース以降、具体的なロードマップを公開していません。本モデルは、Open Secure AI Alliance(NVIDIAなどと共に)の最初のメンバーとして位置づけられており、ポリシー適応型セーフティの基盤的構成要素として期待されています。Mistralが「フルスタックプレイヤー」を目指す戦略(データセンターのチップからソフトウェアアプリケーションまでをカバー)を考慮すれば、将来のバージョンでは更なる大規模化、対応モダリティの拡大、あるいはMistralのエージェンティックツール(Vibe、Forge)やエンタープライズ展開スタックとの緊密な統合が進む可能性があります。ただし、具体的なバージョンリリースのサイクルや機能の時期については、現時点では何も発表されていません。
ShieldstralはApache 2.0ライセンスのオープンウェイトでリリースされているため、どの組織でもMistralとの商用契約なしにモデルをダウンロードし、自社でホスティングすることが可能です。これにより、コンテンツモデレーションのガバナンスを組織内部でコントロールできるようになります。チームは、特定のオーディエンスやデプロイメントコンテキストに合わせて危害分類を調整し、モデルを再学習することなく、自社のリスク許容度に応じて安全性スコアの閾値を設定できます。本モデルは、プロンプトモデレーション、レスポンスモデレーション、プロンプト-レスポンスペア分類、拒否検出、そしてテキストと画像の両方に対する一般的な安全フィルタリングに利用できるよう設計されています。