Am 4. August 2026 veröffentlichte Mistral AI Shieldstral 1.0, einen multimodalen Sicherheitsklassifizierer mit 3 Milliarden Parametern und offenen Gewichten unter der Apache 2.0 Lizenz.

Create a landscape editorial hero image for this Studio Global article: What did Mistral release with Shieldstral, how does its question-answering moderation design work, how did it perform on safety benchmarks,. Article summary: On **August 4, 2026**, Mistral AI released **Shieldstral 1.0**, a 3-billion-parameter open-weights multimodal safety classifier under the **Apache 2.0 license** [1][3][6]. It reframes content moderation as a binary quest. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Am 4. August 2026 veröffentlichte Mistral AI Shieldstral 1.0, einen multimodalen Sicherheitsklassifizierer mit 3 Milliarden Parametern und offenen Gewichten unter der Apache-2.0-Lizenz. Es stellt die Inhaltsmoderation als binäre Frage-Antwort-Aufgabe dar, sodass Betreiber Sicherheitsrichtlinien in natürlicher Sprache zur Inferenzzeit formulieren können – ohne erneutes Training . Das Modell erreicht oder übertrifft Schutzmodelle mit bis zu 7× seiner Größe bei Text-Sicherheits-Benchmarks und setzt einen neuen Bestwert bei der multimodalen Sicherheitsklassifizierung
.
Shieldstral bewertet Inhalte anhand einer Richtlinie, die als Ja/Nein-Frage in natürlicher Sprache formuliert ist. Eine Anfrage besteht aus drei Teilen :
Das Modell gibt einen einzelnen, kontinuierlichen Sicherheits-Score aus einem Vorwärtsdurchlauf zurück, der für eine binäre Entscheidung (sicher/unsicher) mit einem Schwellenwert versehen werden kann . Mistral empfiehlt eine Richtlinie pro Abfrage; für mehrere Richtlinien erhält jede ihren eigenen Inferenzaufruf
.
Dieses Design macht eine feste Schadens-Taxonomie überflüssig, die während des Trainings festgelegt wird. Stattdessen passt sich Shieldstral jeder Richtlinie an, die ein Entwickler als Ja/Nein-Frage formulieren kann – so lassen sich verschiedene Sicherheitsdatensätze, die auf unterschiedlichen Taxonomien basieren, in einem einzigen Trainingsrahmen konsolidieren .
Shieldstral erreicht oder übertrifft offene Schutzmodelle mit bis zu 7× seiner Größe bei der Textsicherheit und setzt einen neuen Bestwert bei der multimodalen Sicherheit . Die folgenden Ergebnisse stammen aus Mistrals veröffentlichten Bewertungen
:
Text-Sicherheitsklassifizierung – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Multimodale Sicherheit – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Gesamt-F1 für Textsicherheit: 84,9%; multimodale Sicherheit F1: 83,8% – vor allen getesteten Modellen . Bei der Textsicherheit liegt Shieldstral mit 84,9 % gleichauf mit GPT-OSS-Safeguard-20B, einem Modell, das fast 7× so groß ist
.
Mistral hat keinen spezifischen Fahrplan für Shieldstral über die Version 1.0 hinaus veröffentlicht. Das Modell ist als Gründungsmitglied der Open Secure AI Alliance (mit NVIDIA und anderen) positioniert und als grundlegender Baustein für politikadaptive Sicherheit . Angesichts von Mistrals erklärter Ambition, ein „Full-Stack-Player“ im KI-Bereich zu sein – von Chips in Rechenzentren bis hin zu Softwareanwendungen – könnten zukünftige Versionen von Shieldstral einen größeren Maßstab, eine breitere Modalitätsunterstützung oder eine engere Integration mit Mistrals agentischen Tools (Vibe, Forge) und dem Enterprise-Bereitstellungs-Stack bieten
. Es wurde weder eine Versionskadenz noch ein spezifischer Feature-Zeitplan bekannt gegeben.
Da Shieldstral unter offenen Gewichten mit einer Apache-2.0-Lizenz veröffentlicht wird, kann jede Organisation das Modell herunterladen und selbst hosten, ohne eine kommerzielle Vereinbarung mit Mistral treffen zu müssen . Dies verlagert die Governance der Inhaltsmoderation ins Haus: Teams können Schadens-Taxonomien an bestimmte Zielgruppen oder Bereitstellungskontexte anpassen, ohne das zugrunde liegende Modell neu trainieren zu müssen, und sie können Sicherheits-Scores mit Schwellenwerten versehen, um ihr eigenes Risiko-Toleranzniveau zu erreichen
. Das Modell ist für die Prompt-Moderation, Antwort-Moderation, Prompt-Antwort-Paar-Klassifizierung, Verweigerungserkennung und allgemeine Sicherheitsfilterung über Text- und Bildeingaben hinweg konzipiert
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Am 4. August 2026 veröffentlichte Mistral AI Shieldstral 1.0, einen multimodalen Sicherheitsklassifizierer mit 3 Milliarden Parametern und offenen Gewichten unter der Apache 2.0 Lizenz.
Am 4. August 2026 veröffentlichte Mistral AI Shieldstral 1.0, einen multimodalen Sicherheitsklassifizierer mit 3 Milliarden Parametern und offenen Gewichten unter der Apache 2.0 Lizenz. Eine Anfrage besteht aus drei Teilen: <Instruct (Bewertungskontext und Strenge), <Query (eine einzelne Ja/Nein Frage zum Inhalt) und <Document (der zu bewertende Inhalt – Prompt, Antwort, Paar oder Bild).
Shieldstral läuft auf einer einzelnen 16 GB NVIDIA GPU, unterstützt 12 Sprachen, hat einen 32k Token Kontextfenster und verarbeitet Text, Bild sowie Text+Bild Modalitäten.