Shieldstral valuta i contenuti confrontandoli con una policy espressa come una domanda sì/no in linguaggio naturale. Una richiesta è composta da tre parti :
Il modello restituisce un unico punteggio di sicurezza continuo da una singola passata in avanti, che può essere sogliato per una decisione binaria sicuro/non sicuro . Mistral consiglia una policy per query; per policy multiple, ognuna richiede una chiamata di inferenza separata .
Questo design elimina la necessità di una tassonomia del danno fissa incorporata durante l'addestramento. Invece, Shieldstral si adatta a qualsiasi policy che uno sviluppatore possa esprimere come domanda sì/no — rendendo possibile consolidare diversi dataset di sicurezza costruiti su tassonomie differenti in un unico framework di addestramento .
Shieldstral eguaglia o supera modelli di barriera aperti fino a 7× la sua dimensione nella sicurezza testuale e stabilisce un nuovo stato dell'arte nella sicurezza multimodale . I seguenti risultati provengono dalle valutazioni pubblicate da Mistral :
Classificazione di sicurezza testuale — F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Sicurezza multimodale — F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
F1 complessiva per la sicurezza testuale: 84,9%; F1 per la sicurezza multimodale: 83,8% — superiore a tutti i modelli testati . Sulla sicurezza testuale, l'84,9% di Shieldstral è in parità con GPT-OSS-Safeguard-20B, un modello quasi 7 volte più grande .
| Specifica | Dettaglio |
|---|---|
| Parametri | 3,8B attivi |
| Modello base | Ministral-3-3B-Base-2512 con codificatore visivo Pixtral nativo |
| Modalità | Testo, immagine e testo+immagine |
| Finestra di contesto | 32k token (addestrato); teoricamente supporta fino a 256k |
| Hardware | Funziona su una singola GPU NVIDIA da 16 GB |
| Lingue | Inglese, francese, spagnolo, tedesco, italiano, portoghese, olandese, cinese, giapponese, coreano, arabo, russo |
| Output | Singolo token sì/no con punteggio di confidenza continuo |
| Dati di addestramento | ~54,1 milioni di campioni curati e generati utilizzando la messa a punto LoRA e l'unione di checkpoint SLERP |
| Licenza | Apache 2.0 — pesi aperti per uso commerciale e non commerciale |
Mistral non ha pubblicato una roadmap specifica per Shieldstral oltre il rilascio 1.0. Il modello è posizionato come membro inaugurale dell'Open Secure AI Alliance (con NVIDIA e altri) e come blocco fondamentale per la sicurezza adattiva alle policy . Considerando l'ambizione dichiarata di Mistral di essere un "attore full-stack" nell'IA — dai chip nei data center alle applicazioni software — le iterazioni future di Shieldstral potrebbero vedere una scala maggiore, un supporto più ampio per le modalità o un'integrazione più stretta con gli strumenti agenziali di Mistral (Vibe, Forge) e lo stack di distribuzione aziendale . Non sono stati annunciati né una cadenza di versioni né una tempistica specifica per le funzionalità.
Poiché Shieldstral è rilasciato con pesi aperti e licenza Apache 2.0, qualsiasi organizzazione può scaricare e ospitare il modello autonomamente senza un accordo commerciale con Mistral . Questo sposta la governance della moderazione dei contenuti all'interno dell'organizzazione: i team possono adattare le tassonomie del danno a pubblici o contesti di implementazione specifici senza riaddestrare il modello sottostante, e possono sogliare i punteggi di sicurezza in base alla propria tolleranza al rischio . Il modello è progettato per la moderazione di prompt, risposte, la classificazione di coppie prompt-risposta, il rilevamento di rifiuti e il filtraggio generale di sicurezza su input di testo e immagini .