Shieldstral vurderer indhold op imod en politik, der er formuleret som et ja/nej-spørgsmål i almindeligt sprog. En forespørgsel består af tre dele :
Modellen returnerer en enkelt kontinuerlig sikkerhedsscore fra ét enkelt gennemløb, som kan tærskelværdiindstilles for en binær sikker/usikker-beslutning . Mistral anbefaler én politik pr. forespørgsel; for flere politikker får hver sin egen inferens .
Dette design eliminerer behovet for en fast taksonomi for skadeligt indhold, der er indbygget under træning. I stedet tilpasser Shieldstral sig til enhver politik, en udvikler kan udtrykke som et ja/nej-spørgsmål – hvilket gør det muligt at samle forskellige sikkerhedsdatasæt bygget på forskellige taksonomier i én enkelt træningsramme .
Shieldstral matcher eller overgår åbne beskyttelsesmodeller op til 7× sin størrelse på tekstsikkerhed og sætter ny rekord for multimodal sikkerhed . Følgende resultater stammer fra Mistrals offentliggjorte evalueringer :
Tekstsikkerhedsklassifikation – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Multimodal sikkerhed – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Samlet tekstsikkerheds-F1: 84,9 %; multimodal sikkerheds-F1: 83,8 % – bedre end alle testede modeller . På tekstsikkerhed er Shieldstral's 84,9 % på niveau med GPT-OSS-Safeguard-20B, en model næsten 7× sin størrelse .
| Specifikation | Detalje |
|---|---|
| Parametre | 3,8B aktive |
| Basismodel | Ministral-3-3B-Base-2512 med indbygget Pixtral-synsencoder |
| Modaliteter | Tekst, billede og tekst+billede |
| Kontekstvindue | 32k tokens (trænet); understøtter teoretisk op til 256k |
| Hardware | Kører på én 16GB NVIDIA GPU |
| Sprog | Engelsk, fransk, spansk, tysk, italiensk, portugisisk, hollandsk, kinesisk, japansk, koreansk, arabisk, russisk |
| Output | Enkelt-token ja/nej med kontinuerlig konfidensscore |
| Træningsdata | ~54,1M kuraterede og genererede prøver ved hjælp af LoRA-fintuning og SLERP checkpoint-fletning |
| Licens | Apache 2.0 – åbne vægte til kommerciel og ikke-kommerciel brug |
Mistral har ikke offentliggjort en specifik køreplan for Shieldstral ud over 1.0-udgivelsen. Modellen er positioneret som et indledende medlem af Open Secure AI Alliance (sammen med NVIDIA og andre) og som en grundlæggende byggesten for politik-adaptiv sikkerhed . Givet Mistrals erklærede ambition om at være en "full-stack-aktør" inden for AI – fra chips i datacentre til softwareapplikationer – kan fremtidige iterationer af Shieldstral få større skala, bredere modalitetsunderstøttelse eller tættere integration med Mistrals agentiske værktøjer (Vibe, Forge) og virksomhedsimplementeringsstak . Ingen versionsrytme eller specifik funktionstidslinje er blevet annonceret.
Fordi Shieldstral er udgivet med åbne vægte under Apache 2.0-licensen, kan enhver organisation downloade og selv hoste modellen uden en kommerciel aftale med Mistral . Dette flytter content moderation-governance internt: teams kan tilpasse skadelighedstaksonomier til specifikke målgrupper eller implementeringskontekster uden at genoptræne den underliggende model, og de kan tærskelværdiindstille sikkerhedsscorer for at matche deres egen risikotolerance . Modellen er designet til promptmoderation, responsmoderation, prompt–svar-par-klassifikation, afvisningsdetektion og generel sikkerhedsfiltrering på tværs af tekst- og billedinput .