Shieldstral оценивает контент на соответствие политике, сформулированной в виде вопроса на естественном языке, требующего ответа «да» или «нет». Запрос состоит из трех частей :
Модель возвращает единую непрерывную оценку безопасности за один прямой проход, которую можно порогово обработать для принятия бинарного решения «безопасно/небезопасно» . Mistral рекомендует использовать одну политику на запрос; для нескольких политик каждая получает свой вызов инференса .
Такая конструкция устраняет необходимость в фиксированной таксономии вредоносности, заложенной во время обучения. Вместо этого Shieldstral адаптируется к любой политике, которую разработчик может выразить в виде вопроса «да/нет» — это позволяет объединять разнородные наборы данных по безопасности, построенные на разных таксономиях, в единую структуру обучения .
Shieldstral не уступает или превосходит открытые модели-ограничители до 7× своего размера в текстовой безопасности и устанавливает новый стандарт в мультимодальной безопасности . Ниже приведены результаты из опубликованных оценок Mistral :
Классификация текстовой безопасности — F1 (%)
| Бенчмарк | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Мультимодальная безопасность — F1 (%)
| Бенчмарк | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Общий показатель F1 для текстовой безопасности: 84.9%; для мультимодальной безопасности: 83.8% — выше, чем у всех протестированных моделей . В текстовой безопасности Shieldstral показывает 84.9%, что равно показателю GPT-OSS-Safeguard-20B — модели почти в 7 раз больше .
| Характеристика | Детали |
|---|---|
| Параметры | 3.8B активных |
| Базовая модель | Ministral-3-3B-Base-2512 с нативным кодировщиком изображений Pixtral |
| Модальности | Текст, изображение и текст+изображение |
| Окно контекста | 32k токенов (обучено); теоретически поддерживает до 256k |
| Аппаратное обеспечение | Работает на одном графическом процессоре NVIDIA с 16 ГБ |
| Языки | Английский, французский, испанский, немецкий, итальянский, португальский, голландский, китайский, японский, корейский, арабский, русский |
| Выходные данные | Однотокеновый «да/нет» с непрерывной оценкой уверенности |
| Обучающие данные | ~54.1M отобранных и сгенерированных образцов с использованием тонкой настройки LoRA и слияния контрольных точек SLERP |
| Лицензия | Apache 2.0 — открытые веса для коммерческого и некоммерческого использования |
У Mistral нет опубликованной дорожной карты для Shieldstral после версии 1.0. Модель позиционируется как один из первых участников альянса Open Secure AI Alliance (совместно с NVIDIA и другими) и как фундаментальный строительный блок для адаптивной к политике безопасности . Учитывая амбиции Mistral стать «полноценным игроком» в области ИИ — от чипов в центрах обработки данных до программных приложений, — будущие итерации Shieldstral могут включать больший масштаб, более широкую поддержку модальностей или более тесную интеграцию с агентными инструментами Mistral (Vibe, Forge) и корпоративным стеком развертывания . Никакой периодичности выпуска версий или конкретных сроков реализации функций объявлено не было.
Поскольку Shieldstral выпущен с открытыми весами под лицензией Apache 2.0, любая организация может загрузить и запустить модель самостоятельно без коммерческого соглашения с Mistral . Это переносит управление модерацией контента внутрь компании: команды могут адаптировать таксономии вредоносности под конкретную аудиторию или контекст развертывания без переобучения базовой модели, а также устанавливать пороговые значения оценок безопасности в соответствии с собственным уровнем толерантности к риску . Модель предназначена для модерации промптов, модерации ответов, классификации пар «промпт-ответ», обнаружения отказов и общей фильтрации безопасности для текстовых и графических входных данных .