Shieldstral bedömer innehåll mot en policy som uttrycks som en ja/nej-fråga i naturligt språk. En förfrågan består av tre delar :
Modellen returnerar en enda kontinuerlig säkerhetspoäng från ett enda framåtriktat anrop. Poängen kan trösklas för ett binärt beslut om innehållet är säkert eller inte . Mistral rekommenderar en policy per fråga; om flera policyer behövs görs ett separat anrop för varje .
Den här designen eliminerar behovet av en fast harm-taxonomi som tränats in i modellen. Istället anpassar sig Shieldstral till vilken policy som helst som kan uttryckas som en ja/nej-fråga, vilket gör det möjligt att slå samman olika säkerhetsdataset – även om de bygger på olika taxonomier – i ett enda träningsramverk .
Shieldstral matchar eller överträffar öppna guard-modeller upp till 7× sin storlek på textsäkerhet och sätter en ny standard för multimodal säkerhet . Nedan följer resultat från Mistrals publicerade utvärderingar :
Textsäkerhetsklassificering – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Multimodal säkerhet – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Total F1 för textsäkerhet: 84,9 %; multimodal säkerhet: 83,8 % – före alla testade modeller . Inom textområdet är Shieldstrals 84,9 % identiskt med GPT-OSS-Safeguard-20B, en modell nästan 7× större .
| Specifikation | Detalj |
|---|---|
| Parametrar | 3,8 miljarder aktiva |
| Basmodell | Ministral-3-3B-Base-2512 med inbyggd Pixtral-visionkodare |
| Modaliteter | Text, bild och text+bild |
| Kontextfönster | 32k tokens (tränat); stöder teoretiskt upp till 256k |
| Hårdvara | Körs på ett enda 16GB NVIDIA GPU |
| Språk | Engelska, franska, spanska, tyska, italienska, portugisiska, nederländska, kinesiska, japanska, koreanska, arabiska, ryska |
| Utdata | Enkel token ja/nej med kontinuerlig konfidenspoäng |
| Träningsdata | ~54,1 miljoner sammanställda och genererade prover med LoRA-fintuning och SLERP-merge |
| Licens | Apache 2.0 – öppna vikter för kommersiellt och privat bruk |
Mistral har inte publicerat en specifik färdplan för Shieldstral bortom 1.0-versionen. Modellen presenteras som en grundpelare i det nybildade Open Secure AI Alliance (tillsammans med NVIDIA och andra) . Med tanke på Mistrals ambition att bli en ”full-stack-spelare” inom AI – från chip i datacenter till mjukvaruapplikationer – kan framtida versioner av Shieldstral komma att bli större, få stöd för fler modaliteter eller integreras tätare med Mistrals agentverktyg (Vibe, Forge) och företagsstack . Ingen versionsintervall eller specifik funktionstidslinje har dock tillkännagivits.
Eftersom Shieldstral distribueras med öppna vikter under Apache 2.0-licens kan vilken organisation som helst ladda ner modellen och köra den själv utan kommersiellt avtal med Mistral . Detta flyttar styrningen av innehållsmoderering in-house: team kan skräddarsy sina taxonomier för specifika målgrupper eller sammanhang utan att träna om den underliggande modellen, och de kan själva bestämma tröskelvärden för säkerhetspoängen . Modellen är utformad för promptmoderering, svarsmoderering, klassificering av prompt–svar-par, avvisningsdetektering och allmän säkerhetsfiltrering av text och bilder .