Shieldstral beoordeelt content aan de hand van een beleid dat is uitgedrukt als een duidelijke ja/nee-vraag. Een verzoek bestaat uit drie delen :
Het model retourneert één continue veiligheidsscore van één enkele forward-pass, die kan worden gedrempeld voor een binaire veilig/onveilig-beslissing . Mistral raadt één beleid per query aan; voor meerdere beleidsregels krijgt elke regel zijn eigen inferentie-aanroep .
Dit ontwerp elimineert de noodzaak van een vaste taxonomie van schade die tijdens de training is ingebakken. In plaats daarvan past Shieldstral zich aan elk beleid aan dat een ontwikkelaar als een ja/nee-vraag kan formuleren — waardoor het mogelijk wordt om diverse veiligheidsdatasets die op verschillende taxonomieën zijn gebouwd, te consolideren in één enkel trainingsraamwerk .
Shieldstral evenaart of overtreft open bewakingsmodellen tot 7× zijn grootte op tekstveiligheid en zet een nieuwe standaard op het gebied van multimodale veiligheid . De volgende resultaten zijn afkomstig van de gepubliceerde evaluaties van Mistral :
Tekstveiligheidsclassificatie — F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Multimodale veiligheid — F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Algemene tekstveiligheid F1: 84,9%; multimodale veiligheid F1: 83,8% — vóór elk getest model . Op tekstveiligheid is de 84,9% van Shieldstral gelijk aan die van GPT-OSS-Safeguard-20B, een model dat bijna 7× zo groot is .
| Specificatie | Detail |
|---|---|
| Parameters | 3,8B actief |
| Basismodel | Ministral-3-3B-Base-2512 met native Pixtral-visie-encoder |
| Modaliteiten | Tekst, afbeelding en tekst+afbeelding |
| Contextvenster | 32k tokens (getraind); ondersteunt theoretisch tot 256k |
| Hardware | Draait op een enkele 16GB NVIDIA GPU |
| Talen | Engels, Frans, Spaans, Duits, Italiaans, Portugees, Nederlands, Chinees, Japans, Koreaans, Arabisch, Russisch |
| Uitvoer | Enkele-token ja/nee met continue vertrouwensscore |
| Trainingsdata | ~54,1M samengestelde en gegenereerde samples met behulp van LoRA fine-tuning en SLERP checkpoint-merging |
| Licentie | Apache 2.0 — open gewichten voor commercieel en niet-commercieel gebruik |
Mistral heeft geen specifieke routekaart gepubliceerd voor Shieldstral na de 1.0-release. Het model wordt gepositioneerd als een inaugureel lid van de Open Secure AI Alliance (met NVIDIA en anderen) en als een fundamenteel bouwblok voor beleidsadaptieve veiligheid . Gezien de geuite ambitie van Mistral om een "full-stack-speler" te zijn in AI — van chips in datacentra tot softwaretoepassingen — zouden toekomstige versies van Shieldstral een grotere schaal, bredere modaliteitondersteuning of een strakkere integratie met de agentische tools van Mistral (Vibe, Forge) en de enterprise-implementatiestack kunnen zien . Er is geen versiecadans of specifieke functietijdlijn aangekondigd.
Omdat Shieldstral wordt uitgebracht onder open gewichten met een Apache 2.0-licentie, kan elke organisatie het model downloaden en zelf hosten zonder een commerciële overeenkomst met Mistral . Dit brengt de governance van contentmoderatie in eigen huis: teams kunnen schadetaxonomieën aanpassen aan specifieke doelgroepen of implementatiecontexten zonder het onderliggende model opnieuw te trainen, en ze kunnen veiligheidsscores drempelen om hun eigen risicotolerantie te evenaren . Het model is ontworpen voor promptmoderatie, antwoordmoderatie, classificatie van prompt-antwoordparen, weigeringsdetectie en algemene veiligheidsfiltering voor tekst- en afbeeldingsinvoer .