يقوم Shieldstral بتقييم المحتوى مقابل سياسة يُعبر عنها كسؤال نعم/لا بلغة طبيعية. يتكون الطلب من ثلاثة أجزاء :
يُرجع النموذج درجة أمان مستمرة واحدة من تمريرة أمامية واحدة، ويمكن تحديد عتبة لاتخاذ قرار ثنائي (آمن/غير آمن) . توصي Mistral باستخدام سياسة واحدة لكل استعلام؛ أما لسياسات متعددة، فيحتاج كل منها إلى استدعاء منفصل
.
هذا التصميم يلغي الحاجة إلى تصنيف ضرر ثابت يتم تضمينه أثناء التدريب. بدلاً من ذلك، يتكيف Shieldstral مع أي سياسة يُمكن للمطور التعبير عنها كسؤال نعم/لا — مما يجعل من الممكن دمج مجموعات بيانات أمان متنوعة مبنية على تصنيفات مختلفة في إطار تدريبي واحد .
يتفوق Shieldstral على نماذج الحماية المفتوحة التي تصل إلى 7 أضعاف حجمه في أمان النص ويحقق نتائج قياسية جديدة في الأمان متعدد الوسائط . فيما يلي نتائج التقييمات المنشورة من Mistral
:
تصنيف أمان النصوص — F1 (%)
| المعيار | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
أمان متعدد الوسائط — F1 (%)
| المعيار | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
متوسط F1 لأمان النصوص: 84.9%؛ للأمان متعدد الوسائط: 83.8% — متقدمًا على كل نموذج تم اختباره . في أمان النصوص، يتعادل Shieldstral (84.9%) مع نموذج GPT-OSS-Safeguard-20B، وهو نموذج أكبر منه بحوالي 7 أضعاف
.
لم تنشر Mistral خارطة طريق محددة لـ Shieldstral بعد إصدار 1.0. يتم وضع النموذج كعضو مؤسس في تحالف Open Secure AI (مع NVIDIA وغيرها) وككتلة بناء أساسية للأمان القابل للتكيف مع السياسات . بالنظر إلى طموح Mistral المُعلن لكونها "لاعبًا متكاملًا" في AI — من الرقائق في مراكز البيانات إلى تطبيقات البرمجيات — يمكن أن تشهد الإصدارات المستقبلية من Shieldstral نطاقًا أكبر، دعمًا أوسع للوسائط، أو تكاملًا أوثق مع أدوات Mistral الوكيلة (Vibe، Forge) ومجموعة النشر للمؤسسات
. لم يُعلن عن أي وتيرة إصدار أو جدول زمني محدد للميزات.
نظرًا لأن Shieldstral يُصدر بأوزان مفتوحة بموجب ترخيص Apache 2.0، يمكن لأي مؤسسة تنزيله واستضافته ذاتيًا دون اتفاقية تجارية مع Mistral . هذا ينقل حوكمة فحص المحتوى إلى داخل المؤسسة: يمكن للفرق تكييف تصنيفات الضرر لجماهير معينة أو سياقات نشر دون إعادة تدريب النموذج الأساسي، ويمكنهم تحديد عتبات درجات الأمان لتتناسب مع درجة تحملهم للمخاطر
. النموذج مصمم لفحص التعليمات، فحص الردود، تصنيف أزواج التعليمات-الردود، اكتشاف رفض الإجابة، والتصفية العامة للأمان عبر مدخلات النص والصورة
.