O Shieldstral avalia o conteúdo contra uma política expressa como uma pergunta de sim/não em linguagem natural. Uma requisição tem três partes :
O modelo retorna uma pontuação contínua de segurança em uma única passagem, que pode ser limiarizada para uma decisão binária seguro/inseguro . A Mistral recomenda uma política por consulta; para múltiplas políticas, cada uma recebe sua própria chamada de inferência .
Esse design elimina a necessidade de uma taxonomia de danos fixa embutida durante o treinamento. Em vez disso, o Shieldstral se adapta a qualquer política que um desenvolvedor possa expressar como uma pergunta de sim/não — tornando possível consolidar conjuntos de dados de segurança diversos, construídos sobre taxonomias diferentes, em um único framework de treinamento .
O Shieldstral iguala ou supera modelos abertos de guarda até 7× seu tamanho em segurança de texto e estabelece um novo estado da arte em segurança multimodal . Os resultados a seguir são das avaliações publicadas pela Mistral :
Classificação de segurança de texto — F1 (%)
| Benchmark | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Segurança multimodal — F1 (%)
| Benchmark | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
F1 geral em segurança de texto: 84,9%; F1 em segurança multimodal: 83,8% — à frente de todos os modelos testados . Em segurança de texto, o Shieldstral empata com o GPT-OSS-Safeguard-20B, um modelo quase 7× maior .
| Especificação | Detalhe |
|---|---|
| Parâmetros | 3,8B ativos |
| Modelo base | Ministral-3-3B-Base-2512 com codificador de visão nativo Pixtral |
| Modalidades | Texto, imagem e texto+imagem |
| Janela de contexto | 32k tokens (treinado); suporta teoricamente até 256k |
| Hardware | Roda em uma única GPU NVIDIA de 16 GB |
| Idiomas | Inglês, francês, espanhol, alemão, italiano, português, holandês, chinês, japonês, coreano, árabe, russo |
| Saída | Sim/não de token único com pontuação de confiança contínua |
| Dados de treinamento | ~54,1M amostras curadas e geradas usando LoRA fine-tuning e SLERP checkpoint merging |
| Licença | Apache 2.0 — pesos abertos para uso comercial e não comercial |
A Mistral não publicou um roadmap específico para o Shieldstral além do lançamento 1.0. O modelo é posicionado como um membro inaugural da Open Secure AI Alliance (com NVIDIA e outros) e como um bloco de construção fundamental para segurança adaptativa a políticas . Dada a ambição declarada da Mistral de ser uma "full-stack player" em IA — de chips em data centers a aplicativos de software — futuras iterações do Shieldstral podem ver maior escala, suporte a mais modalidades ou integração mais estreita com as ferramentas de agente da Mistral (Vibe, Forge) e sua stack de implantação empresarial . Nenhuma cadência de versão ou cronograma de funcionalidades específicas foi anunciada.
Como o Shieldstral é lançado sob pesos abertos com licença Apache 2.0, qualquer organização pode baixar e auto-hospedar o modelo sem um acordo comercial com a Mistral . Isso transfere a governança da moderação de conteúdo para dentro de casa: as equipes podem adaptar as taxonomias de danos a públicos ou contextos de implantação específicos sem retreinar o modelo subjacente, e podem limiarizar as pontuações de segurança para corresponder à sua própria tolerância ao risco . O modelo é projetado para moderação de prompts, moderação de respostas, classificação de pares prompt-resposta, detecção de recusa e filtragem geral de segurança em entradas de texto e imagem .