Mistral AI udostępnił 4 sierpnia 2026 roku Shieldstral 1.0 – otwarty klasyfikator bezpieczeństwa (3 miliardy parametrów) na licencji Apache 2.0. Model opiera się na zadawaniu pytań „tak/nie” do treści.

Create a landscape editorial hero image for this Studio Global article: What did Mistral release with Shieldstral, how does its question-answering moderation design work, how did it perform on safety benchmarks,. Article summary: On **August 4, 2026**, Mistral AI released **Shieldstral 1.0**, a 3-billion-parameter open-weights multimodal safety classifier under the **Apache 2.0 license** [1][3][6]. It reframes content moderation as a binary quest. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
4 sierpnia 2026 roku Mistral AI wypuścił Shieldstral 1.0 – klasyfikator bezpieczeństwa multimodalnego z otwartymi wagami (3 miliardy parametrów) na licencji Apache 2.0 . Zamiast sztywnej taksonomii szkodliwych treści model zadaje pytania w języku naturalnym i odpowiada „tak/nie”. Dzięki temu operatorzy mogą definiować polityki bezpieczeństwa w locie, bez potrzeby przekwalifikowywania
. Shieldstral dorównuje lub przewyższa modele zabezpieczające nawet 7× większe
.
Shieldstral ocenia treść na podstawie polityki wyrażonej jako proste pytanie. Każde zapytanie składa się z trzech części :
Model zwraca ciągły wynik bezpieczeństwa, który można progować na decyzję binarną . Mistral zaleca jedno pytanie na zapytanie; dla wielu polityk wykonuje się osobne wywołania
.
Takie podejście eliminuje potrzebę wbudowanej w model, sztywnej taksonomii. Shieldstral dostosowuje się do dowolnej polityki, którą można zapisać jako pytanie .
Shieldstral dorównuje lub bije otwarte modele nawet 7× większe od siebie w testach bezpieczeństwa tekstu i wyznacza nowy stan sztuki w multimodalnej klasyfikacji bezpieczeństwa . Poniższe dane pochodzą z opublikowanych przez Mistrala ewaluacji
:
Klasyfikacja bezpieczeństwa tekstu – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Bezpieczeństwo multimodalne – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Ogólne F1 dla bezpieczeństwa tekstu: 84,9%; dla multimodalnego: 83,8% – lepiej niż każdy testowany model . Wynik tekstowy (84,9%) to remis z GPT-OSS-Safeguard-20B, który ma prawie 7× więcej parametrów
.
Mistral nie opublikował konkretnej mapy drogowej dla Shieldstral poza wersją 1.0. Model jest pozycjonowany jako pierwszy członek Open Secure AI Alliance (wraz z NVIDIA i innymi) oraz fundament dla polityk bezpieczeństwa, które można dostosowywać . Biorąc pod uwagę ambicję Mistrala, by być „full-stack playerem” w AI — od układów w centrach danych po aplikacje — przyszłe wersje Shieldstral mogą oferować większą skalę, szersze wsparcie modalności lub głębszą integrację z narzędziami agentowymi (Vibe, Forge) i stosem wdrożeniowym dla przedsiębiorstw
. Nie ogłoszono jednak żadnego harmonogramu ani konkretnych planów funkcji.
Ponieważ Shieldstral jest wydany pod otwartą licencją Apache 2.0, każda organizacja może pobrać i uruchomić model samodzielnie, bez umowy handlowej z Mistralem . To przenosi odpowiedzialność za moderację treści do wewnątrz firmy: zespoły mogą dostosować taksonomie szkodliwości do konkretnych odbiorców lub kontekstów bez przekwalifikowania modelu, a także ustawić własne progi bezpieczeństwa
. Model jest przeznaczony do moderowania promptów, odpowiedzi, par prompt–odpowiedź, wykrywania odmów oraz ogólnego filtrowania bezpieczeństwa w tekście i obrazach
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Mistral AI udostępnił 4 sierpnia 2026 roku Shieldstral 1.0 – otwarty klasyfikator bezpieczeństwa (3 miliardy parametrów) na licencji Apache 2.0.
Mistral AI udostępnił 4 sierpnia 2026 roku Shieldstral 1.0 – otwarty klasyfikator bezpieczeństwa (3 miliardy parametrów) na licencji Apache 2.0. Model opiera się na zadawaniu pytań „tak/nie” do treści. Wystarczy podać instrukcję kontekstową, pytanie dotyczące polityki i dokument do oceny (tekst, obraz lub oba).
Shieldstral działa na pojedynczej karcie NVIDIA z 16 GB pamięci, obsługuje 12 języków i ma 32 tys.