Shieldstral analyse un contenu à l'aune d'une politique exprimée sous la forme d'une question fermée (oui/non). Chaque requête se décompose en trois parties :
<Instruct> : le cadre général de l'évaluation — le contexte et le niveau de sévérité (et, optionnellement, la définition de ce qui est considéré comme dangereux).<Query> : une seule question fermée sur le document, par exemple « Ce contenu encourage-t-il la violence physique ? »<Document> : le contenu à évaluer — un prompt, une réponse, un couple prompt-réponse, ou une image (éventuellement accompagnée de texte).En un seul passage avant (forward pass), le modèle renvoie un score de sécurité continu que l'on peut seuiller pour une décision binaire (sûr / non sûr) . Mistral recommande une politique par requête ; pour plusieurs politiques, il faut lancer plusieurs inférences .
Cette conception élimine le besoin d'une taxonomie des dangers fixée lors de l'entraînement. Shieldstral s'adapte à n'importe quelle politique qu'un développeur peut formuler comme une question oui/non, ce qui permet de consolider des jeux de données de sécurité hétérogènes (construits sur des taxonomies différentes) en un seul framework d'apprentissage .
Shieldstral atteint ou surpasse les modèles de garde ouverts jusqu'à 7 fois plus gros que lui sur la sécurité textuelle, et établit un nouvel état de l'art sur la sécurité multimodale . Voici les résultats publiés par Mistral :
Classification de sécurité textuelle — F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Sécurité multimodale — F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Le F1 global sur le texte atteint 84,9 % ; le F1 multimodal 83,8 % — soit les meilleurs scores parmi tous les modèles testés . Sur le texte, le score de Shieldstral (84,9 %) est à égalité avec celui de GPT-OSS-Safeguard-20B, un modèle pourtant près de 7 fois plus volumineux .
| Spécification | Détail |
|---|---|
| Paramètres | 3,8 milliards actifs |
| Modèle de base | Ministral-3-3B-Base-2512 avec encodeur visuel natif Pixtral |
| Modalités | Texte, image, et texte + image |
| Fenêtre de contexte | 32 000 tokens (entraîné) ; support théorique jusqu'à 256 000 tokens |
| Matériel requis | Un seul GPU NVIDIA 16 Go |
| Langues | Anglais, français, espagnol, allemand, italien, portugais, néerlandais, chinois, japonais, coréen, arabe, russe |
| Format de sortie | Jeton unique oui/non avec score de confiance continu |
| Données d'entraînement | ~54,1 millions d'échantillons (curatés et générés) via LoRA et fusion de checkpoints SLERP |
| Licence | Apache 2.0 — poids ouverts pour usage commercial et non commercial |
Avec une licence Apache 2.0 et des poids ouverts, Shieldstral peut être téléchargé et hébergé par n'importe quelle organisation sans accord commercial avec Mistral . Cela transfère la gouvernance de la modération en interne : les équipes adaptent leurs taxonomies des dangers à des publics ou des contextes de déploiement spécifiques sans réentraîner le modèle, et peuvent seuiller les scores de sécurité selon leur propre tolérance au risque . Le modèle est conçu pour la modération des prompts, des réponses, la classification des paires prompt-réponse, la détection des refus et le filtrage général de sécurité sur des entrées textuelles et visuelles .
Mistral n'a pas publié de feuille de route spécifique pour Shieldstral au-delà de cette version 1.0. Le modèle est présenté comme un membre fondateur de l'alliance Open Secure AI Alliance (avec NVIDIA et d'autres) et comme un bloc de construction fondamental pour une sécurité adaptable aux politiques . Compte tenu de l'ambition affichée de Mistral d'être un acteur « full-stack » de l'IA — des puces dans les datacenters jusqu'aux applications logicielles — de futures versions de Shieldstral pourraient voir une échelle plus grande, un support de modalités plus large, ou une intégration plus poussée avec les outils agents de Mistral (Vibe, Forge) et sa pile de déploiement pour les entreprises . Aucun rythme de version ni calendrier de fonctionnalités n'a été annoncé.
En résumé, Shieldstral 1.0 est un modèle de sécurité aussi puissant qu'accessible : il démocratise la modération de contenu de pointe en la rendant open-source, légère et éminemment adaptable. Pour les développeurs et les entreprises, c'est un outil qui redéfinit le rapport entre performance et ressources.