실드스트럴은 평이한 언어로 작성된 예/아니오 질문 형태의 정책을 바탕으로 콘텐츠를 평가합니다. 요청은 다음 세 부분으로 구성됩니다:
모델은 단일 순방향 패스(forward pass)에서 하나의 연속적인 안전 점수를 반환하며, 이 점수는 임계값을 기준으로 이진(안전/불안전) 결정으로 변환될 수 있습니다. 미스트랄은 쿼리당 하나의 정책을 권장하며, 여러 정책을 적용해야 하는 경우 각각 별도의 추론 호출을 사용하도록 안내합니다.
이러한 설계는 훈련 단계에서 고정된 유해 분류 체계(harm taxonomy)를 내장할 필요를 없앱니다. 대신, 실드스트럴은 개발자가 예/아니오 질문으로 표현할 수 있는 모든 정책에 적응할 수 있으며, 서로 다른 분류 체계를 기반으로 구축된 다양한 안전 데이터셋을 단일 훈련 프레임워크로 통합하는 것을 가능하게 합니다.
실드스트럴은 텍스트 안전 분야에서 자체 크기의 최대 7배에 달하는 오픈 가드 모델과 동등하거나 더 나은 성능을 보였으며, 멀티모달 안전 분야에서는 새로운 최고 기록을 세웠습니다. 다음은 미스트랄이 공개한 평가 결과입니다:
텍스트 안전 분류 — F1 (%)
| 벤치마크 | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
멀티모달 안전 — F1 (%)
| 벤치마크 | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
전체 텍스트 안전 F1 점수는 **84.9%**이고, 멀티모달 안전 F1 점수는 **83.8%**로, 테스트된 모든 모델을 앞질렀습니다. 텍스트 안전의 경우, 실드스트럴의 84.9%는 거의 7배 큰 모델인 GPT-OSS-Safeguard-20B와 동률을 이루었습니다.
| 사양 | 세부 사항 |
|---|---|
| 파라미터 | 3.8B 활성 파라미터 |
| 기본 모델 | Ministral-3-3B-Base-2512, 네이티브 Pixtral 비전 인코더 탑재 |
| 모달리티 | 텍스트, 이미지, 텍스트+이미지 |
| 컨텍스트 창 | 32k 토큰(훈련 기준); 이론적으로 최대 256k 지원 |
| 하드웨어 | 단일 16GB NVIDIA GPU에서 실행 가능 |
| 언어 | 영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 중국어, 일본어, 한국어, 아랍어, 러시아어 |
| 출력 | 단일 토큰 예/아니오 및 연속 신뢰도 점수 |
| 훈련 데이터 | 약 5,410만 개의 큐레이션 및 생성된 샘플, LoRA 미세 조정 및 SLERP 체크포인트 병합 사용 |
| 라이선스 | 아파치 2.0 — 상업적 및 비상업적 용도로 오픈 웨이트 제공 |
미스트랄은 실드스트럴 1.0 출시 이후 구체적인 로드맵을 발표하지 않았습니다. 이 모델은 **오픈 시큐어 AI 얼라이언스(Open Secure AI Alliance, NVIDIA 등 참여)**의 첫 번째 멤버이자, 정책 적응형 안전을 위한 기초 구성 요소로 자리매김하고 있습니다. 미스트랄이 AI 분야에서 '풀스택 플레이어(full-stack player)'가 되겠다는 야망을 밝힌 점을 고려할 때, 향후 실드스트럴 버전은 더 큰 규모, 더 폭넓은 모달리티 지원, 또는 미스트랄의 에이전트 도구(Vibe, Forge) 및 엔터프라이즈 배포 스택과의 긴밀한 통합을 제공할 가능성이 있습니다. 그러나 현재까지 특정 버전 주기나 기능 일정은 공개되지 않았습니다.
실드스트럴은 아파치 2.0 라이선스 하에 오픈 웨이트로 제공되므로, 모든 조직이 미스트랄과의 별도 상업 계약 없이 모델을 다운로드하여 자체 호스팅할 수 있습니다. 이는 콘텐츠 모더레이션 거버넌스를 조직 내부로 가져오는 효과가 있습니다. 팀은 기초 모델을 재훈련하지 않고도 특정 사용자층이나 배포 환경에 맞게 유해 분류 체계를 조정할 수 있으며, 자체 위험 허용 수준에 맞춰 안전 점수의 임계값을 설정할 수 있습니다. 이 모델은 프롬프트 모더레이션, 응답 모더레이션, 프롬프트-응답 쌍 분류, 거절 감지, 그리고 텍스트 및 이미지 입력 전반에 걸친 일반적인 안전 필터링에 사용하도록 설계되었습니다.