Shieldstral оцінює контент на основі політики, вираженої у вигляді звичайного запитання «так/ні». Кожен запит складається з трьох частин :
Модель повертає єдиний безперервний показник безпеки за один прямий прохід, який можна порогувати для прийняття бінарного рішення «безпечно/небезпечно» . Mistral рекомендує використовувати одну політику на запит; для кількох політик потрібен окремий виклик для кожної .
Така конструкція усуває потребу у фіксованій таксономії шкідливості, зашитій у модель під час тренування. Натомість Shieldstral адаптується до будь-якої політики, яку розробник може сформулювати у вигляді запитання «так/ні», що дозволяє об'єднати різноманітні набори даних безпеки, створені на основі різних таксономій, в єдиний тренувальний каркас .
Shieldstral не поступається або перевершує відкриті моделі-охоронці, що в 7 разів більші, на текстових бенчмарках і встановлює новий стандарт у мультимодальній безпеці . Нижче наведено результати з опублікованих оцінок Mistral :
Текстова класифікація безпеки — F1 (%)
| Бенчмарк | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Мультимодальна безпека — F1 (%)
| Бенчмарк | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Загальний показник F1 для текстової безпеки: 84.9%; для мультимодальної: 83.8% — вище, ніж у всіх протестованих моделей . На текстових завданнях Shieldstral з показником 84.9% йде нарівні з GPT-OSS-Safeguard-20B — моделлю, що майже в 7 разів більша .
| Характеристика | Деталі |
|---|---|
| Параметри | 3.8B активних |
| Базова модель | Ministral-3-3B-Base-2512 із вбудованим візійним енкодером Pixtral |
| Модальності | Текст, зображення та текст+зображення |
| Контекстне вікно | 32 тис. токенів (тренувальне); теоретично підтримує до 256 тис. |
| Апаратне забезпечення | Працює на одному 16 ГБ GPU NVIDIA |
| Мови | Англійська, французька, іспанська, німецька, італійська, португальська, нідерландська, китайська, японська, корейська, арабська, російська |
| Вихідні дані | Одне слово «так/ні» з безперервним показником впевненості |
| Тренувальні дані | ~54.1 млн курованих і згенерованих зразків із використанням LoRA-тонкого налаштування та злиття контрольних точок SLERP |
| Ліцензія | Apache 2.0 — відкрита вага для комерційного та некомерційного використання |
Mistral не опублікував конкретної дорожньої карти для Shieldstral після версії 1.0. Модель позиціонується як перший учасник Open Secure AI Alliance (разом із NVIDIA та іншими) і як фундаментальний будівельний блок для політико-адаптивної безпеки . З огляду на заявлену амбіцію Mistral стати «гравцем повного стеку» в ШІ — від чіпів у центрах обробки даних до програмних застосунків — майбутні версії Shieldstral можуть отримати більший масштаб, ширшу підтримку модальностей або тіснішу інтеграцію з агентними інструментами Mistral (Vibe, Forge) та корпоративним стеком розгортання . Жодних термінів виходу нових версій чи конкретного списку функцій оголошено не було.
Оскільки Shieldstral випущено з відкритою вагою під ліцензією Apache 2.0, будь-яка організація може завантажити та самостійно розгорнути модель без комерційної угоди з Mistral . Це переносить управління модерацією контенту всередину компанії: команди можуть адаптувати таксономії шкідливості до конкретних аудиторій або контекстів розгортання без перетренування базової моделі та встановлювати порогові значення показників безпеки відповідно до власної толерантності до ризику . Модель призначена для модерації запитів, модерації відповідей, класифікації пар «запит-відповідь», виявлення відмов та загальної фільтрації безпеки для текстових і графічних даних .