Shieldstral menilai kandungan berdasarkan dasar yang dinyatakan sebagai soalan ya/tidak dalam bahasa biasa. Setiap permintaan mempunyai tiga bahagian :
Model ini mengembalikan satu skor keselamatan berterusan daripada satu hantaran ke hadapan, yang boleh diambang untuk keputusan selamat/tidak selamat . Mistral mengesyorkan satu dasar setiap pertanyaan; untuk pelbagai dasar, setiap dasar memerlukan panggilan inferens sendiri .
Reka bentuk ini menghapuskan keperluan untuk taksonomi bahaya tetap yang dibenamkan semasa latihan. Sebaliknya, Shieldstral menyesuaikan diri dengan mana-mana dasar yang boleh dinyatakan oleh pembangun sebagai soalan ya/tidak — membolehkan penyatuan pelbagai set data keselamatan yang dibina berdasarkan taksonomi berbeza ke dalam satu rangka kerja latihan .
Shieldstral menandingi atau mengatasi model pengawal terbuka sehingga 7× saiznya dalam keselamatan teks dan menetapkan tahap baharu dalam keselamatan multimodal . Keputusan berikut adalah daripada penilaian yang diterbitkan Mistral :
Klasifikasi keselamatan teks — F1 (%)
| Penanda Aras | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Keselamatan multimodal — F1 (%)
| Penanda Aras | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Keseluruhan F1 keselamatan teks: 84.9%; keselamatan multimodal F1: 83.8% — mendahului setiap model yang diuji . Untuk keselamatan teks, 84.9% Shieldstral adalah sama dengan GPT-OSS-Safeguard-20B, model yang hampir 7× saiznya .
| Spesifikasi | Butiran |
|---|---|
| Parameter | 3.8B aktif |
| Model asas | Ministral-3-3B-Base-2512 dengan pengekod penglihatan Pixtral asli |
| Modaliti | Teks, imej, dan teks+imej |
| Tetingkap konteks | 32k token (dilatih); secara teori menyokong sehingga 256k |
| Perkakasan | Berjalan pada GPU NVIDIA 16GB tunggal |
| Bahasa | Inggeris, Perancis, Sepanyol, Jerman, Itali, Portugis, Belanda, Cina, Jepun, Korea, Arab, Rusia |
| Output | Ya/tidak token tunggal dengan skor keyakinan berterusan |
| Data latihan | ~54.1M sampel yang dikurasi dan dijana menggunakan penalaan halus LoRA dan penggabungan pusat pemeriksaan SLERP |
| Lesen | Apache 2.0 — pemberat terbuka untuk kegunaan komersial dan bukan komersial |
Mistral tidak menerbitkan peta jalan khusus untuk Shieldstral selepas keluaran 1.0. Model ini diposisikan sebagai ahli sulung Open Secure AI Alliance (bersama NVIDIA dan lain-lain) dan sebagai blok binaan asas untuk keselamatan yang boleh menyesuaikan dasar . Memandangkan cita-cita Mistral yang dinyatakan untuk menjadi "pemain penuh-stack" dalam AI — daripada cip di pusat data kepada aplikasi perisian — lelaran Shieldstral pada masa hadapan mungkin melihat skala yang lebih besar, sokongan modaliti yang lebih luas, atau integrasi yang lebih ketat dengan alat agen Mistral (Vibe, Forge) dan timbunan penggunaan perusahaan . Tiada kaden versi atau garis masa ciri khusus telah diumumkan.
Oleh kerana Shieldstral dikeluarkan di bawah pemberat terbuka dengan lesen Apache 2.0, mana-mana organisasi boleh memuat turun dan mengehos sendiri model ini tanpa perjanjian komersial dengan Mistral . Ini mengalihkan tadbir urus moderasi kandungan ke dalam rumah: pasukan boleh menyesuaikan taksonomi bahaya kepada khalayak atau konteks penggunaan tertentu tanpa melatih semula model asas, dan mereka boleh mengambang skor keselamatan untuk dipadankan dengan toleransi risiko mereka sendiri . Model ini direka untuk moderasi prompt, moderasi respons, klasifikasi pasangan prompt-respons, pengesanan penolakan, dan penapisan keselamatan am merentas input teks dan imej .