Mistral AIは2026年8月4日、Apache 2.0ライセンスのオープンウェイトマルチモーダル安全性分類器「Shieldstral 1.0」(3Bパラメータ)を公開した。 リクエストは3つのパートで構成される。評価コンテキストと厳格さを定義する<Instruct 、コンテンツに関する単一のYes/No質問である<Query 、評価対象のコンテンツ(プロンプト、レスポンス、ペア、画像)である<Document 。

Create a landscape editorial hero image for this Studio Global article: What did Mistral release with Shieldstral, how does its question-answering moderation design work, how did it perform on safety benchmarks,. Article summary: On **August 4, 2026**, Mistral AI released **Shieldstral 1.0**, a 3-billion-parameter open-weights multimodal safety classifier under the **Apache 2.0 license** [1][3][6]. It reframes content moderation as a binary quest. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
2026年8月4日、フランスのMistral AIは、3B(30億)パラメータのオープンウェイトマルチモーダル安全性分類器「Shieldstral 1.0」 を、Apache 2.0ライセンスでリリースしました。このモデルは、コンテンツモデレーションを二値(Yes/No)の質問応答タスクとして再定義し、開発者が推論時にポリシーを自然言語で記述するだけで、再学習なしにモデレーションを実行できるようにします
。その性能は、7倍の規模を持つ他のガードモデルにテキスト安全性で匹敵、あるいは凌駕し、マルチモーダル安全性では新たな最高性能(SOTA)を達成しています
。
Shieldstralは、ポリシーを平易なYes/Noの質問として受け取り、コンテンツを評価します。リクエストは以下の3つのパートで構成されます。
モデルは1回のフォワードパスで連続的な安全性スコアを返し、閾値を設定することで二値(安全/不安全)の判定に用いることができます。Mistralは、1つのクエリにつき1つのポリシーを推奨しており、複数のポリシーを評価する場合は、それぞれ別の推論呼び出しを行います
。
この設計により、トレーニング時に固定された危害分類(タクソノミー)をモデルに組み込む必要がなくなります。開発者はYes/Noの質問で表現できるあらゆるポリシーにShieldstralを適応させることができ、異なるタクソノミーに基づく多様な安全性データセットを、単一のトレーニングフレームワークで統合することを可能にします。
Shieldstralは、テキスト安全性評価において、7倍のサイズのオープンガードモデルに匹敵するか、それを上回り、マルチモーダル安全性評価では新たなSOTAを達成しています。以下は、Mistralが公開した評価結果です
。
テキスト安全性分類 — F1値 (%)
| ベンチマーク | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
マルチモーダル安全性 — F1値 (%)
| ベンチマーク | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
テキスト安全性の総合F1値は 84.9%、マルチモーダル安全性では 83.8% となり、テストされたすべてのモデルを上回りました。テキスト安全性においては、約7倍のサイズであるGPT-OSS-Safeguard-20Bと同点(84.9%)の結果を示しています
。
Mistralは、Shieldstral 1.0のリリース以降、具体的なロードマップを公開していません。本モデルは、Open Secure AI Alliance(NVIDIAなどと共に)の最初のメンバーとして位置づけられており、ポリシー適応型セーフティの基盤的構成要素として期待されています。Mistralが「フルスタックプレイヤー」を目指す戦略(データセンターのチップからソフトウェアアプリケーションまでをカバー)を考慮すれば、将来のバージョンでは更なる大規模化、対応モダリティの拡大、あるいはMistralのエージェンティックツール(Vibe、Forge)やエンタープライズ展開スタックとの緊密な統合が進む可能性があります
。ただし、具体的なバージョンリリースのサイクルや機能の時期については、現時点では何も発表されていません。
ShieldstralはApache 2.0ライセンスのオープンウェイトでリリースされているため、どの組織でもMistralとの商用契約なしにモデルをダウンロードし、自社でホスティングすることが可能です。これにより、コンテンツモデレーションのガバナンスを組織内部でコントロールできるようになります。チームは、特定のオーディエンスやデプロイメントコンテキストに合わせて危害分類を調整し、モデルを再学習することなく、自社のリスク許容度に応じて安全性スコアの閾値を設定できます
。本モデルは、プロンプトモデレーション、レスポンスモデレーション、プロンプト-レスポンスペア分類、拒否検出、そしてテキストと画像の両方に対する一般的な安全フィルタリングに利用できるよう設計されています
。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Mistral AIは2026年8月4日、Apache 2.0ライセンスのオープンウェイトマルチモーダル安全性分類器「Shieldstral 1.0」(3Bパラメータ)を公開した。
Mistral AIは2026年8月4日、Apache 2.0ライセンスのオープンウェイトマルチモーダル安全性分類器「Shieldstral 1.0」(3Bパラメータ)を公開した。 リクエストは3つのパートで構成される。評価コンテキストと厳格さを定義する<Instruct 、コンテンツに関する単一のYes/No質問である<Query 、評価対象のコンテンツ(プロンプト、レスポンス、ペア、画像)である<Document 。
Shieldstralは16GBのNVIDIA GPU1つで動作し、12言語をサポート、32Kトークンのコンテキストウィンドウを持ち、テキスト、画像、テキスト+画像のモダリティを処理する。