Shieldstral bewertet Inhalte anhand einer Richtlinie, die als Ja/Nein-Frage in natürlicher Sprache formuliert ist. Eine Anfrage besteht aus drei Teilen :
Das Modell gibt einen einzelnen, kontinuierlichen Sicherheits-Score aus einem Vorwärtsdurchlauf zurück, der für eine binäre Entscheidung (sicher/unsicher) mit einem Schwellenwert versehen werden kann . Mistral empfiehlt eine Richtlinie pro Abfrage; für mehrere Richtlinien erhält jede ihren eigenen Inferenzaufruf .
Dieses Design macht eine feste Schadens-Taxonomie überflüssig, die während des Trainings festgelegt wird. Stattdessen passt sich Shieldstral jeder Richtlinie an, die ein Entwickler als Ja/Nein-Frage formulieren kann – so lassen sich verschiedene Sicherheitsdatensätze, die auf unterschiedlichen Taxonomien basieren, in einem einzigen Trainingsrahmen konsolidieren .
Shieldstral erreicht oder übertrifft offene Schutzmodelle mit bis zu 7× seiner Größe bei der Textsicherheit und setzt einen neuen Bestwert bei der multimodalen Sicherheit . Die folgenden Ergebnisse stammen aus Mistrals veröffentlichten Bewertungen :
Text-Sicherheitsklassifizierung – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Multimodale Sicherheit – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Gesamt-F1 für Textsicherheit: 84,9%; multimodale Sicherheit F1: 83,8% – vor allen getesteten Modellen . Bei der Textsicherheit liegt Shieldstral mit 84,9 % gleichauf mit GPT-OSS-Safeguard-20B, einem Modell, das fast 7× so groß ist .
| Spezifikation | Detail |
|---|---|
| Parameter | 3,8 Mrd. aktiv |
| Basismodell | Ministral-3-3B-Base-2512 mit nativem Pixtral-Vision-Encoder |
| Modalitäten | Text, Bild und Text+Bild |
| Kontextfenster | 32k Tokens (trainiert); theoretisch bis zu 256k |
| Hardware | Läuft auf einer einzelnen 16 GB NVIDIA GPU |
| Sprachen | Englisch, Französisch, Spanisch, Deutsch, Italienisch, Portugiesisch, Niederländisch, Chinesisch, Japanisch, Koreanisch, Arabisch, Russisch |
| Ausgabe | Einzel-Token Ja/Nein mit kontinuierlichem Konfidenzwert |
| Trainingsdaten | ~54,1 Mio. kuratierte und generierte Stichproben mit LoRA-Feintuning und SLERP-Checkpoint-Merging |
| Lizenz | Apache 2.0 – offene Gewichte für kommerzielle und nicht-kommerzielle Nutzung |
Mistral hat keinen spezifischen Fahrplan für Shieldstral über die Version 1.0 hinaus veröffentlicht. Das Modell ist als Gründungsmitglied der Open Secure AI Alliance (mit NVIDIA und anderen) positioniert und als grundlegender Baustein für politikadaptive Sicherheit . Angesichts von Mistrals erklärter Ambition, ein „Full-Stack-Player“ im KI-Bereich zu sein – von Chips in Rechenzentren bis hin zu Softwareanwendungen – könnten zukünftige Versionen von Shieldstral einen größeren Maßstab, eine breitere Modalitätsunterstützung oder eine engere Integration mit Mistrals agentischen Tools (Vibe, Forge) und dem Enterprise-Bereitstellungs-Stack bieten . Es wurde weder eine Versionskadenz noch ein spezifischer Feature-Zeitplan bekannt gegeben.
Da Shieldstral unter offenen Gewichten mit einer Apache-2.0-Lizenz veröffentlicht wird, kann jede Organisation das Modell herunterladen und selbst hosten, ohne eine kommerzielle Vereinbarung mit Mistral treffen zu müssen . Dies verlagert die Governance der Inhaltsmoderation ins Haus: Teams können Schadens-Taxonomien an bestimmte Zielgruppen oder Bereitstellungskontexte anpassen, ohne das zugrunde liegende Modell neu trainieren zu müssen, und sie können Sicherheits-Scores mit Schwellenwerten versehen, um ihr eigenes Risiko-Toleranzniveau zu erreichen . Das Modell ist für die Prompt-Moderation, Antwort-Moderation, Prompt-Antwort-Paar-Klassifizierung, Verweigerungserkennung und allgemeine Sicherheitsfilterung über Text- und Bildeingaben hinweg konzipiert .