Shieldstral vurderer innhold mot en policy som uttrykkes som et enkelt ja/nei-spørsmål. En forespørsel består av tre deler :
Modellen returnerer én enkelt kontinuerlig trygghetsscore fra ett enkelt gjennomkjøring (forward pass). Du kan sette en grenseverdi for å ta en binær trygg/utrygg-beslutning . Mistral anbefaler én policy per forespørsel; hvis du har flere regelsett, får hver sin runde .
Denne utformingen gjør at du ikke trenger en fast liste over faretyper som er innebygd under trening. I stedet tilpasser Shieldstral seg alle regler du kan formulere som et ja/nei-spørsmål – noe som også gjør det mulig å samle ulike sikkerhetsdatasett med forskjellige farekategorier i ett felles treningsrammeverk .
Shieldstral matcher eller slår åpne beskyttelsesmodeller opptil 7 ganger størrelsen på tekstsikkerhet og setter ny standard for multimodal sikkerhet . Tabellene under er hentet fra Mistrals publiserte evalueringer :
Tekstsikkerhetsklassifisering – F1 (%)
| Måling | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Multimodal sikkerhet – F1 (%)
| Måling | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Samlet F1 for tekstsikkerhet: 84,9%; for multimodal sikkerhet: 83,8% – bedre enn alle testede modeller . På tekstsikkerhet ligger Shieldstral likt med GPT-OSS-Safeguard-20B, en modell som er nesten 7 ganger større .
| Spesifikasjon | Detaljer |
|---|---|
| Parametere | 3,8 milliarder aktive |
| Basismodell | Ministral-3-3B-Base-2512 med innebygd Pixtral-bildeprosessor |
| Innholdstyper | Tekst, bilde og tekst+bilde |
| Kontekstvindu | 32 000 tokens (trent); støtter teoretisk opptil 256 000 |
| Maskinvare | Kjører på ett 16 GB NVIDIA-skjermkort |
| Språk | Engelsk, fransk, spansk, tysk, italiensk, portugisisk, nederlandsk, kinesisk, japansk, koreansk, arabisk, russisk |
| Resultat | Én enkelt yes/no-token med kontinuerlig konfidensscore |
| Treningsdata | Omtrent 54,1 millioner kuraterte og genererte eksempler, trent med LoRA-fintuning og SLERP-sammenslåing av kontrollpunkter |
| Lisens | Apache 2.0 – åpne vekter for kommersiell og ikke-kommersiell bruk |
Mistral har ikke publisert en spesifikk veikart for Shieldstral utover 1.0-utgivelsen. Modellen er posisjonert som et grunnleggende medlem av Open Secure AI Alliance (sammen med NVIDIA og andre) og som en byggestein for policy-tilpasset sikkerhet . Gitt Mistrals ambisjon om å være en «full-stack»-spiller innen AI – fra brikker i datasentre til programvareapplikasjoner – kan fremtidige versjoner av Shieldstral få større skala, bredere støtte for innholdstyper eller tettere integrering med Mistrals agentverktøy (Vibe, Forge) og bedriftsløsninger . Ingen versjonsplan eller konkret tidslinje for nye funksjoner er kunngjort.
Siden Shieldstral er utgitt som åpne vekter under Apache 2.0-lisensen, kan enhver organisasjon laste ned og kjøre modellen selv uten kommersiell avtale med Mistral . Dette flytter ansvaret for innholdsmoderering inn i egen organisasjon: team kan tilpasse farekategoriene til sitt publikum eller bruksområde uten å trene modellen på nytt, og de kan sette egne grenser for trygghetsscoren ut fra sin egen risikovilje . Modellen er designet for promptmoderering, svarmoderering, klassifisering av prompt–svar-par, avslagsdeteksjon og generell sikkerhetsfiltrering av både tekst og bilder .