Shieldstral vyhodnocuje obsah na základě pravidel zapsaných jako jednoduchá ano/ne otázka. Každý požadavek má tři části :
Model z jediného průchodu vrátí jediné spojité skóre bezpečnosti, které lze prahováním převést na binární rozhodnutí „bezpečný/nebezpečný“ . Pro každou politiku se doporučuje jedna otázka; pokud jich je více, každá se volá zvlášť .
Tento návrh odstraňuje potřebu pevné taxonomie škodlivosti, která by byla zabudovaná už při tréninku. Shieldstral se místo toho přizpůsobí jakékoli politice, kterou vývojář dokáže vyjádřit jako ano/ne otázku – což umožňuje sjednotit různorodé bezpečnostní datasety postavené na odlišných taxonomiích do jediného trénovacího rámce .
Shieldstral se v textové bezpečnosti vyrovná nebo překonává otevřené strážní modely až 7× větší a v multimodální bezpečnosti stanovuje nový standard . Následující výsledky pocházejí z publikovaného hodnocení Mistralu :
Textová bezpečnostní klasifikace – F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Multimodální bezpečnost – F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Celkové F1 pro textovou bezpečnost: 84,9 %; pro multimodální bezpečnost: 83,8 % – tedy lepší než všechny testované modely . V textové bezpečnosti je Shieldstralův výsledek 84,9 % shodný s modelem GPT-OSS-Safeguard-20B, který je téměř 7× větší .
| Specifikace | Detail |
|---|---|
| Parametry | 3,8 mld. aktivních |
| Základní model | Ministral-3-3B-Base-2512 s nativním Pixtral kódovačem pro obrázky |
| Modalita | Text, obrázek a text+obrázek |
| Kontextové okno | 32k tokenů (natrénováno); teoreticky až 256k |
| Hardware | Běží na jediném 16GB GPU NVIDIA |
| Jazyky | Angličtina, francouzština, španělština, němčina, italština, portugalština, nizozemština, čínština, japonština, korejština, arabština, ruština |
| Výstup | Jediný token ano/ne se spojitým skóre spolehlivosti |
| Tréninková data | ~54,1 milionu vybraných a vygenerovaných vzorků s využitím dolaďování LoRA a mergování kontrolních bodů SLERP |
| Licence | Apache 2.0 – otevřené váhy pro komerční i nekomerční použití |
Mistral nezveřejnil konkrétní plán pro Shieldstral nad rámec verze 1.0. Model je prezentován jako inaugurační člen Open Secure AI Alliance (společně s NVIDIA a dalšími) a jako základní stavební kámen pro bezpečnost přizpůsobivou pravidlům . Vzhledem k tomu, že Mistral deklaroval ambici být „full-stackovým hráčem“ v AI – od čipů v datových centrech po softwarové aplikace – mohou se budoucí iterace Shieldstralu dočkat většího měřítka, širší podpory modalit nebo těsnější integrace s Mistralovými nástroji pro agenty (Vibe, Forge) a firemním nasazením . Žádný harmonogram verzí ani konkrétní časový plán funkcí nebyl oznámen.
Protože je Shieldstral uvolněn jako otevřené váhy s licencí Apache 2.0, může si jej jakákoli organizace stáhnout a hostovat sama, aniž by s Mistralem potřebovala komerční smlouvu . Tím se správa moderování obsahu přesouvá dovnitř firem: týmy mohou přizpůsobit taxonomie škodlivosti konkrétnímu publiku nebo prostředí nasazení, aniž by přetrénovávaly základní model, a mohou si prahováním skóre bezpečnosti nastavit vlastní míru rizika . Model je navržen pro moderaci promptů i odpovědí, klasifikaci dvojic prompt–odpověď, detekci odmítnutí a obecné bezpečnostní filtrování textových i obrazových vstupů .