Shieldstral, içeriği düz bir dilde yazılmış evet/hayır sorusu olarak ifade edilen bir politikaya karşı değerlendiriyor. Bir istek üç bölümden oluşuyor :
Model, tek bir ileri geçişten sürekli bir güvenlik puanı döndürüyor ve bu puan, ikili bir güvenli/güvensiz kararı için eşiklenebiliyor. Mistral, sorgu başına tek bir politika kullanılmasını öneriyor; birden fazla politika için her biri kendi çıkarım çağrısını alıyor.
Bu tasarım, eğitim sırasında sabitlenmiş bir zarar taksonomisine olan ihtiyacı ortadan kaldırıyor. Bunun yerine Shieldstral, bir geliştiricinin evet/hayır sorusu olarak ifade edebileceği herhangi bir politikaya uyum sağlıyor. Bu sayede, farklı taksonomiler üzerine inşa edilmiş çeşitli güvenlik veri kümelerini tek bir eğitim çerçevesinde birleştirmek mümkün hale geliyor.
Shieldstral, metin güvenliğinde kendisinden 7 kata kadar büyük açık koruma modelleriyle eşleşiyor veya onları geride bırakıyor ve çok modlu güvenlikte yeni bir çığır açıyor. Aşağıdaki sonuçlar Mistral'ın yayınladığı değerlendirmelerden alınmıştır :
Metin güvenliği sınıflandırması — F1 (%)
| Kıyaslama | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Çok modlu güvenlik — F1 (%)
| Kıyaslama | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Genel metin güvenliği F1 puanı: %84.9; çok modlu güvenlik F1 puanı: %83.8 — test edilen tüm modellerin önünde. Metin güvenliğinde, Shieldstral'ın %84.9'u, neredeyse 7 katı büyüklüğündeki GPT-OSS-Safeguard-20B modeliyle eşitleniyor.
| Özellik | Detay |
|---|---|
| Parametreler | 3.8B aktif |
| Temel model | Yerel Pixtral görüntü kodlayıcılı Ministral-3-3B-Base-2512 |
| Biçemler | Metin, görüntü ve metin+görüntü |
| Bağlam penceresi | 32k token (eğitildi); teorik olarak 256k'ya kadar destekler |
| Donanım | Tek bir 16GB NVIDIA GPU'da çalışır |
| Diller | İngilizce, Fransızca, İspanyolca, Almanca, İtalyanca, Portekizce, Felemenkçe, Çince, Japonca, Korece, Arapça, Rusça |
| Çıktı | Sürekli güven puanıyla tek token evet/hayır |
| Eğitim verisi | LoRA ince ayarı ve SLERP kontrol noktası birleştirme kullanılarak yaklaşık 54,1M düzenlenmiş ve oluşturulmuş örnek |
| Lisans | Apache 2.0 — ticari ve ticari olmayan kullanım için açık ağırlıklar |
Mistral, Shieldstral için 1.0 sürümünün ötesinde belirli bir yol haritası yayınlamadı. Model, Open Secure AI Alliance'ın (NVIDIA ve diğerleriyle birlikte) ilk üyesi ve politikaya uyarlanabilir güvenlik için temel bir yapı taşı olarak konumlandırılıyor. Mistral'ın yapay zekada "tam yığın oyuncu" olma hedefi göz önüne alındığında, Shieldstral'ın gelecekteki sürümleri daha büyük ölçek, daha geniş biçem desteği veya Mistral'ın aracı araçları (Vibe, Forge) ve kurumsal dağıtım yığınıyla daha sıkı bir entegrasyon görebilir. Herhangi bir sürüm takvimi veya belirli özellik zaman çizelgesi duyurulmamıştır.
Shieldstral, Apache 2.0 lisansı altında açık ağırlıklarla yayınlandığı için herhangi bir kuruluş, Mistral ile ticari bir anlaşma yapmadan modeli indirebilir ve kendi sunucusunda barındırabilir. Bu, içerik denetimi yönetişimini şirket içine taşıyor: ekipler, temel modeli yeniden eğitmeye gerek kalmadan zarar taksonomilerini belirli kitlelere veya dağıtım bağlamlarına uyarlayabilir ve güvenlik puanlarını kendi risk toleranslarına göre eşikleyebilir. Model, istem denetimi, yanıt denetimi, istem-yanıt çifti sınıflandırması, reddetme tespiti ve metin ile görüntü girdileri arasında genel güvenlik filtrelemesi için tasarlanmıştır.