Mistral AI, 4 Ağustos 2026'da Shieldstral 1.0'ı yayınladı. Bu, 3 milyar parametreli, Apache 2.0 lisanslı, açık ağırlıklı çok modlu bir güvenlik sınıflandırıcısıdır.

Create a landscape editorial hero image for this Studio Global article: What did Mistral release with Shieldstral, how does its question-answering moderation design work, how did it perform on safety benchmarks,. Article summary: On **August 4, 2026**, Mistral AI released **Shieldstral 1.0**, a 3-billion-parameter open-weights multimodal safety classifier under the **Apache 2.0 license** [1][3][6]. It reframes content moderation as a binary quest. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
4 Ağustos 2026'da Mistral AI, Shieldstral 1.0'ı yayınladı. Bu, Apache 2.0 lisansı altında sunulan, 3 milyar parametreli, açık ağırlıklı çok modlu bir güvenlik sınıflandırıcısıdır. Model, içerik denetimini ikili bir soru-cevap görevi olarak yeniden çerçeveliyor ve operatörlerin, yeniden eğitime gerek kalmadan, güvenlik politikalarını çıkarım anında düz dilde yazmasına olanak tanıyor.
Shieldstral, içeriği düz bir dilde yazılmış evet/hayır sorusu olarak ifade edilen bir politikaya karşı değerlendiriyor. Bir istek üç bölümden oluşuyor :
Model, tek bir ileri geçişten sürekli bir güvenlik puanı döndürüyor ve bu puan, ikili bir güvenli/güvensiz kararı için eşiklenebiliyor. Mistral, sorgu başına tek bir politika kullanılmasını öneriyor; birden fazla politika için her biri kendi çıkarım çağrısını alıyor.
Bu tasarım, eğitim sırasında sabitlenmiş bir zarar taksonomisine olan ihtiyacı ortadan kaldırıyor. Bunun yerine Shieldstral, bir geliştiricinin evet/hayır sorusu olarak ifade edebileceği herhangi bir politikaya uyum sağlıyor. Bu sayede, farklı taksonomiler üzerine inşa edilmiş çeşitli güvenlik veri kümelerini tek bir eğitim çerçevesinde birleştirmek mümkün hale geliyor.
Shieldstral, metin güvenliğinde kendisinden 7 kata kadar büyük açık koruma modelleriyle eşleşiyor veya onları geride bırakıyor ve çok modlu güvenlikte yeni bir çığır açıyor. Aşağıdaki sonuçlar Mistral'ın yayınladığı değerlendirmelerden alınmıştır
:
Metin güvenliği sınıflandırması — F1 (%)
| Kıyaslama | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
Çok modlu güvenlik — F1 (%)
| Kıyaslama | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
Genel metin güvenliği F1 puanı: %84.9; çok modlu güvenlik F1 puanı: %83.8 — test edilen tüm modellerin önünde. Metin güvenliğinde, Shieldstral'ın %84.9'u, neredeyse 7 katı büyüklüğündeki GPT-OSS-Safeguard-20B modeliyle eşitleniyor.
Mistral, Shieldstral için 1.0 sürümünün ötesinde belirli bir yol haritası yayınlamadı. Model, Open Secure AI Alliance'ın (NVIDIA ve diğerleriyle birlikte) ilk üyesi ve politikaya uyarlanabilir güvenlik için temel bir yapı taşı olarak konumlandırılıyor. Mistral'ın yapay zekada "tam yığın oyuncu" olma hedefi göz önüne alındığında, Shieldstral'ın gelecekteki sürümleri daha büyük ölçek, daha geniş biçem desteği veya Mistral'ın aracı araçları (Vibe, Forge) ve kurumsal dağıtım yığınıyla daha sıkı bir entegrasyon görebilir.
Herhangi bir sürüm takvimi veya belirli özellik zaman çizelgesi duyurulmamıştır.
Shieldstral, Apache 2.0 lisansı altında açık ağırlıklarla yayınlandığı için herhangi bir kuruluş, Mistral ile ticari bir anlaşma yapmadan modeli indirebilir ve kendi sunucusunda barındırabilir. Bu, içerik denetimi yönetişimini şirket içine taşıyor: ekipler, temel modeli yeniden eğitmeye gerek kalmadan zarar taksonomilerini belirli kitlelere veya dağıtım bağlamlarına uyarlayabilir ve güvenlik puanlarını kendi risk toleranslarına göre eşikleyebilir.
Model, istem denetimi, yanıt denetimi, istem-yanıt çifti sınıflandırması, reddetme tespiti ve metin ile görüntü girdileri arasında genel güvenlik filtrelemesi için tasarlanmıştır.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Mistral AI, 4 Ağustos 2026'da Shieldstral 1.0'ı yayınladı. Bu, 3 milyar parametreli, Apache 2.0 lisanslı, açık ağırlıklı çok modlu bir güvenlik sınıflandırıcısıdır.
Mistral AI, 4 Ağustos 2026'da Shieldstral 1.0'ı yayınladı. Bu, 3 milyar parametreli, Apache 2.0 lisanslı, açık ağırlıklı çok modlu bir güvenlik sınıflandırıcısıdır. Model, içerik denetimini ikili bir soru cevap görevi olarak yeniden tanımlıyor. Geliştiriciler, politika kurallarını çıkarım anında düz metin olarak yazabiliyor ve yeniden eğitime gerek kalmıyor.
Shieldstral, tek bir 16GB NVIDIA GPU'da çalışabiliyor, 12 dili destekliyor ve 32k token bağlam penceresine sahip.