Shieldstral evalúa el contenido según una política expresada como una pregunta de sí/no en lenguaje sencillo. Una solicitud consta de tres partes :
El modelo devuelve una única puntuación de seguridad continua de una sola pasada hacia adelante, que puede ser umbralizada para una decisión binaria de seguro/inseguro . Mistral recomienda una política por consulta; para múltiples políticas, cada una requiere su propia llamada de inferencia .
Este diseño elimina la necesidad de una taxonomía de daños fija integrada durante el entrenamiento. En cambio, Shieldstral se adapta a cualquier política que un desarrollador pueda expresar como una pregunta de sí/no, lo que permite consolidar diversos conjuntos de datos de seguridad construidos sobre diferentes taxonomías en un único marco de entrenamiento .
Shieldstral iguala o supera a modelos de guardia abiertos hasta 7 veces su tamaño en seguridad de texto y establece un nuevo estado del arte en seguridad multimodal . Los siguientes resultados provienen de las evaluaciones publicadas por Mistral :
Clasificación de seguridad de texto — F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Seguridad multimodal — F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
F1 general en seguridad de texto: 84.9%; F1 en seguridad multimodal: 83.8% — por delante de todos los modelos probados . En seguridad de texto, el 84.9% de Shieldstral empata con GPT-OSS-Safeguard-20B, un modelo casi 7 veces más grande .
| Especificación | Detalle |
|---|---|
| Parámetros | 3.8B activos |
| Modelo base | Ministral-3-3B-Base-2512 con codificador de visión Pixtral nativo |
| Modalidades | Texto, imagen y texto+imagen |
| Ventana de contexto | 32k tokens (entrenado); teóricamente soporta hasta 256k |
| Hardware | Funciona en una sola GPU NVIDIA de 16 GB |
| Idiomas | Inglés, francés, español, alemán, italiano, portugués, neerlandés, chino, japonés, coreano, árabe, ruso |
| Salida | Sí/no de un solo token con puntuación de confianza continua |
| Datos de entrenamiento | ~54.1M muestras curadas y generadas usando ajuste fino LoRA y fusión de checkpoints SLERP |
| Licencia | Apache 2.0 — pesos abiertos para uso comercial y no comercial |
Mistral no ha publicado una hoja de ruta específica para Shieldstral más allá del lanzamiento 1.0. El modelo se posiciona como miembro inaugural de la Open Secure AI Alliance (con NVIDIA y otros) y como un bloque de construcción fundamental para la seguridad adaptable a políticas . Dada la ambición declarada de Mistral de ser un "actor de pila completa" en IA — desde chips en centros de datos hasta aplicaciones de software — las futuras iteraciones de Shieldstral podrían ver una escala mayor, soporte para más modalidades, o una integración más estrecha con las herramientas de agentes de Mistral (Vibe, Forge) y su pila de despliegue empresarial . No se ha anunciado ninguna cadencia de versiones ni un cronograma de características específicas.
Debido a que Shieldstral se publica con pesos abiertos bajo la licencia Apache 2.0, cualquier organización puede descargar y alojar el modelo por sí misma sin un acuerdo comercial con Mistral . Esto traslada la gobernanza de la moderación de contenido al ámbito interno: los equipos pueden adaptar las taxonomías de daños a audiencias específicas o contextos de implementación sin reentrenar el modelo subyacente, y pueden umbralizar las puntuaciones de seguridad para que coincidan con su propia tolerancia al riesgo . El modelo está diseñado para la moderación de prompts, moderación de respuestas, clasificación de pares prompt-respuesta, detección de rechazo y filtrado general de seguridad en entradas de texto e imagen .