Shieldstral оцінює контент на основі політики, вираженої у вигляді звичайного запитання «так/ні». Кожен запит складається з трьох частин :
Модель повертає єдиний безперервний показник безпеки за один прямий прохід, який можна порогувати для прийняття бінарного рішення «безпечно/небезпечно» . Mistral рекомендує використовувати одну політику на запит; для кількох політик потрібен окремий виклик для кожної
.
Така конструкція усуває потребу у фіксованій таксономії шкідливості, зашитій у модель під час тренування. Натомість Shieldstral адаптується до будь-якої політики, яку розробник може сформулювати у вигляді запитання «так/ні», що дозволяє об'єднати різноманітні набори даних безпеки, створені на основі різних таксономій, в єдиний тренувальний каркас .
Shieldstral не поступається або перевершує відкриті моделі-охоронці, що в 7 разів більші, на текстових бенчмарках і встановлює новий стандарт у мультимодальній безпеці . Нижче наведено результати з опублікованих оцінок Mistral
:
Текстова класифікація безпеки — F1 (%)
| Бенчмарк | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Мультимодальна безпека — F1 (%)
| Бенчмарк | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Загальний показник F1 для текстової безпеки: 84.9%; для мультимодальної: 83.8% — вище, ніж у всіх протестованих моделей . На текстових завданнях Shieldstral з показником 84.9% йде нарівні з GPT-OSS-Safeguard-20B — моделлю, що майже в 7 разів більша
.
Mistral не опублікував конкретної дорожньої карти для Shieldstral після версії 1.0. Модель позиціонується як перший учасник Open Secure AI Alliance (разом із NVIDIA та іншими) і як фундаментальний будівельний блок для політико-адаптивної безпеки . З огляду на заявлену амбіцію Mistral стати «гравцем повного стеку» в ШІ — від чіпів у центрах обробки даних до програмних застосунків — майбутні версії Shieldstral можуть отримати більший масштаб, ширшу підтримку модальностей або тіснішу інтеграцію з агентними інструментами Mistral (Vibe, Forge) та корпоративним стеком розгортання
. Жодних термінів виходу нових версій чи конкретного списку функцій оголошено не було.
Оскільки Shieldstral випущено з відкритою вагою під ліцензією Apache 2.0, будь-яка організація може завантажити та самостійно розгорнути модель без комерційної угоди з Mistral . Це переносить управління модерацією контенту всередину компанії: команди можуть адаптувати таксономії шкідливості до конкретних аудиторій або контекстів розгортання без перетренування базової моделі та встановлювати порогові значення показників безпеки відповідно до власної толерантності до ризику
. Модель призначена для модерації запитів, модерації відповідей, класифікації пар «запит-відповідь», виявлення відмов та загальної фільтрації безпеки для текстових і графічних даних
.