Shieldstral mengevaluasi konten terhadap kebijakan yang dinyatakan sebagai pertanyaan ya/tidak dalam bahasa sehari-hari. Sebuah permintaan memiliki tiga bagian :
Model mengembalikan satu skor keamanan berkelanjutan dari satu forward pass, yang dapat diberi ambang batas untuk keputusan aman/tidak aman biner . Mistral merekomendasikan satu kebijakan per kueri; untuk banyak kebijakan, masing-masing mendapatkan panggilan inferensi sendiri .
Desain ini menghilangkan kebutuhan akan taksonomi bahaya tetap yang tertanam selama pelatihan. Sebaliknya, Shieldstral beradaptasi dengan kebijakan apa pun yang dapat diungkapkan pengembang sebagai pertanyaan ya/tidak — memungkinkan penggabungan kumpulan data keamanan beragam yang dibangun di atas taksonomi berbeda ke dalam kerangka pelatihan tunggal .
Shieldstral menyamai atau mengungguli model pengaman terbuka hingga 7× ukurannya pada keamanan teks dan menetapkan standar baru pada keamanan multimodal . Hasil berikut berasal dari evaluasi yang diterbitkan Mistral :
Klasifikasi keamanan teks — F1 (%)
| Tolok Ukur | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Keamanan multimodal — F1 (%)
| Tolok Ukur | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Skor F1 keamanan teks keseluruhan: 84,9%; keamanan multimodal: 83,8% — unggul dari semua model yang diuji . Pada keamanan teks, Shieldstral dengan 84,9% seri dengan GPT-OSS-Safeguard-20B, model hampir 7× ukurannya .
| Spesifikasi | Detail |
|---|---|
| Parameter | 3,8B aktif |
| Model dasar | Ministral-3-3B-Base-2512 dengan encoder visi Pixtral asli |
| Modalitas | Teks, gambar, serta teks+gambar |
| Jendela konteks | 32k token (terlatih); secara teoritis mendukung hingga 256k |
| Perangkat keras | Berjalan di satu GPU NVIDIA 16GB |
| Bahasa | Inggris, Prancis, Spanyol, Jerman, Italia, Portugis, Belanda, Mandarin, Jepang, Korea, Arab, Rusia |
| Keluaran | Satu token ya/tidak dengan skor keyakinan berkelanjutan |
| Data pelatihan | ~54,1 juta sampel yang dikurasi dan dihasilkan menggunakan fine-tuning LoRA dan penggabungan checkpoint SLERP |
| Lisensi | Apache 2.0 — bobot terbuka untuk penggunaan komersial dan non-komersial |
Mistral belum menerbitkan peta jalan spesifik untuk Shieldstral di luar rilis 1.0. Model ini diposisikan sebagai anggota perdana Open Secure AI Alliance (dengan NVIDIA dan lainnya) serta sebagai fondasi untuk keamanan yang adaptif terhadap kebijakan . Mengingat ambisi Mistral yang dinyatakan sebagai "full-stack player" di AI — mulai dari chip di pusat data hingga aplikasi perangkat lunak — iterasi Shieldstral di masa depan dapat mencakup skala yang lebih besar, dukungan modalitas yang lebih luas, atau integrasi yang lebih erat dengan alat agen Mistral (Vibe, Forge) dan tumpukan penyebaran perusahaan . Belum ada jadwal versi atau garis waktu fitur spesifik yang diumumkan.
Karena Shieldstral dirilis di bawah bobot terbuka dengan lisensi Apache 2.0, organisasi mana pun dapat mengunduh dan menghosting sendiri model tersebut tanpa perjanjian komersial dengan Mistral . Ini mengalihkan tata kelola moderasi konten ke internal: tim dapat menyesuaikan taksonomi bahaya untuk audiens tertentu atau konteks penyebaran tanpa melatih ulang model yang mendasarinya, dan mereka dapat memberi ambang batas skor keamanan untuk mencocokkan toleransi risiko mereka sendiri . Model ini dirancang untuk moderasi prompt, moderasi respons, klasifikasi pasangan prompt-respons, deteksi penolakan, dan penyaringan keamanan umum di seluruh input teks dan gambar .