המודל מחזיר ציון בטיחות רציף יחיד ממעבר קדימה אחד, אותו ניתן לחתוך לצורך החלטה בינארית של בטוח/לא בטוח . Mistral ממליצה על מדיניות אחת לכל שאילתה; עבור מדיניות מרובה, כל אחת מקבלת קריאת הסקה משלה
.
עיצוב זה מבטל את הצורך בטקסונומיית נזק קבועה שהוטמעה באימון. במקום זאת, Shieldstral מסתגל לכל מדיניות שמפתח יכול לבטא כשאלת כן/לא – מה שמאפשר לאחד מערכי נתונים מגוונים של בטיחות, הבנויים על טקסונומיות שונות, למסגרת אימון יחידה .
Shieldstral משתווה או גובר על מודלי שמירה פתוחים הגדולים ממנו עד פי 7 במדדי בטיחות טקסט, וקובע סטנדרט חדש בתחום הבטיחות המולטי-מודאלית . התוצאות הבאות מגיעות מהערכות שפורסמו על ידי Mistral
:
סיווג בטיחות טקסט – F1 (%)
| מדד | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
בטיחות מולטי-מודאלית – F1 (%)
| מדד | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
F1 כללי בבטיחות טקסט: 84.9%; F1 בבטיחות מולטי-מודאלית: 83.8% – לפני כל מודל שנבדק . בבטיחות טקסט, הציון 84.9% של Shieldstral שווה לזה של GPT-OSS-Safeguard-20B, מודל שגדול ממנו כמעט פי 7
.
Mistral לא פרסמה מפת דרכים ספציפית עבור Shieldstral מעבר לשחרור 1.0. המודל מוצג כחבר מייסד של Open Secure AI Alliance (יחד עם NVIDIA ואחרות) וכאבן בניין בסיסית לבטיחות מותאמת-מדיניות . לאור שאיפתה המוצהרת של Mistral להיות "שחקנית מלאה" בתעשיית הבינה המלאכותית – משבבים במרכזי נתונים ועד יישומי תוכנה – גרסאות עתידיות של Shieldstral עשויות לכלול קנה מידה גדול יותר, תמיכה רחבה יותר במודאליויות, או אינטגרציה הדוקה יותר עם כלי הסוכן של Mistral (Vibe, Forge) וערימת הפריסה הארגונית
. לא הוכרז על קצב גרסאות או ציר זמן ספציפי לתכונות.
מאחר ש-Shieldstral משוחרר תחת משקלים פתוחים עם רישיון Apache 2.0, כל ארגון יכול להוריד ולארח את המודל בעצמו ללא הסכם מסחרי עם Mistral . זה מעביר את הממשל של ניהול התוכן פנימה: צוותים יכולים להתאים טקסונומיות נזק לקהלים ספציפיים או הקשרי פריסה מבלי לאמן מחדש את המודל הבסיסי, והם יכולים לחתוך ציוני בטיחות כך שיתאימו לפרופיל הסיכון שלהם
. המודל מיועד לניהול פרומפטים, ניהול תגובות, סיווג זוגות פרומפט-תגובה, זיהוי סירוב, וסינון בטיחות כללי בטקסט ותמונה
.