Shieldstral מעריך תוכן לעומת מדיניות המוצגת כשאלת כן/לא בשפה טבעית. בקשה מורכבת משלושה חלקים :
המודל מחזיר ציון בטיחות רציף יחיד ממעבר קדימה אחד, אותו ניתן לחתוך לצורך החלטה בינארית של בטוח/לא בטוח . Mistral ממליצה על מדיניות אחת לכל שאילתה; עבור מדיניות מרובה, כל אחת מקבלת קריאת הסקה משלה .
עיצוב זה מבטל את הצורך בטקסונומיית נזק קבועה שהוטמעה באימון. במקום זאת, Shieldstral מסתגל לכל מדיניות שמפתח יכול לבטא כשאלת כן/לא – מה שמאפשר לאחד מערכי נתונים מגוונים של בטיחות, הבנויים על טקסונומיות שונות, למסגרת אימון יחידה .
Shieldstral משתווה או גובר על מודלי שמירה פתוחים הגדולים ממנו עד פי 7 במדדי בטיחות טקסט, וקובע סטנדרט חדש בתחום הבטיחות המולטי-מודאלית . התוצאות הבאות מגיעות מהערכות שפורסמו על ידי Mistral :
סיווג בטיחות טקסט – F1 (%)
| מדד | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
בטיחות מולטי-מודאלית – F1 (%)
| מדד | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
F1 כללי בבטיחות טקסט: 84.9%; F1 בבטיחות מולטי-מודאלית: 83.8% – לפני כל מודל שנבדק . בבטיחות טקסט, הציון 84.9% של Shieldstral שווה לזה של GPT-OSS-Safeguard-20B, מודל שגדול ממנו כמעט פי 7 .
| מפרט | פירוט |
|---|---|
| פרמטרים | 3.8B פעילים |
| מודל בסיס | Ministral-3-3B-Base-2512 עם מקודד תמונה Pixtral מובנה |
| מודאליות | טקסט, תמונה, וטקסט+תמונה |
| חלון הקשר | 32k טוקנים (אומן); תיאורטית תומך עד 256k |
| חומרה | פועל על כרטיס NVIDIA GPU יחיד בנפח 16GB |
| שפות | אנגלית, צרפתית, ספרדית, גרמנית, איטלקית, פורטוגזית, הולנדית, סינית, יפנית, קוריאנית, ערבית, רוסית |
| פלט | טוקן יחיד של כן/לא עם ציון אמון רציף |
| נתוני אימון | ~54.1M דגימות שאוצרו ונוצרו תוך שימוש ב-LoRA fine-tuning ומיזוג נקודות ביקורת SLERP |
| רישיון | Apache 2.0 – משקלים פתוחים לשימוש מסחרי ולא-מסחרי |
Mistral לא פרסמה מפת דרכים ספציפית עבור Shieldstral מעבר לשחרור 1.0. המודל מוצג כחבר מייסד של Open Secure AI Alliance (יחד עם NVIDIA ואחרות) וכאבן בניין בסיסית לבטיחות מותאמת-מדיניות . לאור שאיפתה המוצהרת של Mistral להיות "שחקנית מלאה" בתעשיית הבינה המלאכותית – משבבים במרכזי נתונים ועד יישומי תוכנה – גרסאות עתידיות של Shieldstral עשויות לכלול קנה מידה גדול יותר, תמיכה רחבה יותר במודאליויות, או אינטגרציה הדוקה יותר עם כלי הסוכן של Mistral (Vibe, Forge) וערימת הפריסה הארגונית . לא הוכרז על קצב גרסאות או ציר זמן ספציפי לתכונות.
מאחר ש-Shieldstral משוחרר תחת משקלים פתוחים עם רישיון Apache 2.0, כל ארגון יכול להוריד ולארח את המודל בעצמו ללא הסכם מסחרי עם Mistral . זה מעביר את הממשל של ניהול התוכן פנימה: צוותים יכולים להתאים טקסונומיות נזק לקהלים ספציפיים או הקשרי פריסה מבלי לאמן מחדש את המודל הבסיסי, והם יכולים לחתוך ציוני בטיחות כך שיתאימו לפרופיל הסיכון שלהם . המודל מיועד לניהול פרומפטים, ניהול תגובות, סיווג זוגות פרומפט-תגובה, זיהוי סירוב, וסינון בטיחות כללי בטקסט ותמונה .