Shieldstral ocenia treść na podstawie polityki wyrażonej jako proste pytanie. Każde zapytanie składa się z trzech części :
Model zwraca ciągły wynik bezpieczeństwa, który można progować na decyzję binarną . Mistral zaleca jedno pytanie na zapytanie; dla wielu polityk wykonuje się osobne wywołania .
Takie podejście eliminuje potrzebę wbudowanej w model, sztywnej taksonomii. Shieldstral dostosowuje się do dowolnej polityki, którą można zapisać jako pytanie .
Shieldstral dorównuje lub bije otwarte modele nawet 7× większe od siebie w testach bezpieczeństwa tekstu i wyznacza nowy stan sztuki w multimodalnej klasyfikacji bezpieczeństwa . Poniższe dane pochodzą z opublikowanych przez Mistrala ewaluacji :
Klasyfikacja bezpieczeństwa tekstu – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Bezpieczeństwo multimodalne – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Ogólne F1 dla bezpieczeństwa tekstu: 84,9%; dla multimodalnego: 83,8% – lepiej niż każdy testowany model . Wynik tekstowy (84,9%) to remis z GPT-OSS-Safeguard-20B, który ma prawie 7× więcej parametrów .
| Specyfikacja | Szczegóły |
|---|---|
| Parametry | 3,8 mld aktywnych |
| Model bazowy | Ministral-3-3B-Base-2512 z natywnym enkoderem wizyjnym Pixtral |
| Modalności | Tekst, obraz, tekst+obraz |
| Okno kontekstowe | 32 tys. tokenów (trening); teoretycznie do 256 tys. |
| Sprzęt | Działa na jednej karcie NVIDIA z 16 GB |
| Języki | Angielski, francuski, hiszpański, niemiecki, włoski, portugalski, niderlandzki, chiński, japoński, koreański, arabski, rosyjski |
| Wynik | Pojedynczy token „tak/nie” z ciągłym wskaźnikiem pewności |
| Dane treningowe | ~54,1 mln próbek – zebranych i wygenerowanych, z użyciem LoRA i łączenia punktów kontrolnych SLERP |
| Licencja | Apache 2.0 – wagi otwarte do użytku komercyjnego i niekomercyjnego |
Mistral nie opublikował konkretnej mapy drogowej dla Shieldstral poza wersją 1.0. Model jest pozycjonowany jako pierwszy członek Open Secure AI Alliance (wraz z NVIDIA i innymi) oraz fundament dla polityk bezpieczeństwa, które można dostosowywać . Biorąc pod uwagę ambicję Mistrala, by być „full-stack playerem” w AI — od układów w centrach danych po aplikacje — przyszłe wersje Shieldstral mogą oferować większą skalę, szersze wsparcie modalności lub głębszą integrację z narzędziami agentowymi (Vibe, Forge) i stosem wdrożeniowym dla przedsiębiorstw . Nie ogłoszono jednak żadnego harmonogramu ani konkretnych planów funkcji.
Ponieważ Shieldstral jest wydany pod otwartą licencją Apache 2.0, każda organizacja może pobrać i uruchomić model samodzielnie, bez umowy handlowej z Mistralem . To przenosi odpowiedzialność za moderację treści do wewnątrz firmy: zespoły mogą dostosować taksonomie szkodliwości do konkretnych odbiorców lub kontekstów bez przekwalifikowania modelu, a także ustawić własne progi bezpieczeństwa . Model jest przeznaczony do moderowania promptów, odpowiedzi, par prompt–odpowiedź, wykrywania odmów oraz ogólnego filtrowania bezpieczeństwa w tekście i obrazach .