Shieldstral को एक रिक्वेस्ट देने के लिए तीन हिस्से होते हैं :
इसके बाद मॉडल एक बार फॉरवर्ड पास करता है और सिर्फ एक वैल्यू (कंटीन्यूअस सेफ्टी स्कोर) रिटर्न करता है। इस स्कोर को थ्रेशोल्ड करके तय किया जा सकता है कि कंटेंट सुरक्षित है या नहीं । मिस्ट्रल की सलाह है कि हर सवाल के लिए एक ही नीति का इस्तेमाल करें। अगर कई नीतियां हैं, तो हर एक के लिए अलग-अलग कॉल करना होगा ।
सबसे बड़ी बात यह है कि इस डिज़ाइन में आपको पहले से तय हार्म टैक्सोनॉमी (नुकसान की श्रेणियां) की ज़रूरत नहीं है। आप किसी भी नीति को एक साधारण हां या ना वाले सवाल में बदल सकते हैं, और Shieldstral उसके मुताबिक काम करेगा। यही वजह है कि अलग-अलग टैक्सोनॉमी पर बने डेटासेट्स को भी एक ही ट्रेनिंग फ्रेमवर्क में जोड़ा जा सकता है ।
मिस्ट्रल AI के अनुसार, Shieldstral टेक्स्ट सेफ्टी में अपने आकार से 7 गुना बड़े ओपन गार्ड मॉडल्स को टक्कर देता है या उनसे बेहतर प्रदर्शन करता है। वहीं, मल्टीमॉडल (टेक्स्ट+इमेज) सेफ्टी में यह नया स्टेट-ऑफ-द-आर्ट है । आइए आंकड़ों पर नज़र डालते हैं :
टेक्स्ट सेफ्टी क्लासिफिकेशन — F1 (%)
| बेंचमार्क | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
मल्टीमॉडल सेफ्टी — F1 (%)
| बेंचमार्क | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
कुल मिलाकर टेक्स्ट सेफ्टी में इसका F1 स्कोर 84.9% और मल्टीमॉडल सेफ्टी में 83.8% है - जो सभी परीक्षण किए गए मॉडलों से आगे है । खास बात यह है कि टेक्स्ट सेफ्टी में 84.9% का स्कोर GPT-OSS-Safeguard-20B (लगभग 7 गुना बड़ा मॉडल) के बराबर है ।
| विशिष्टता | विवरण |
|---|---|
| पैरामीटर | 3.8B एक्टिव |
| बेस मॉडल | Ministral-3-3B-Base-2512, नेटिव Pixtral विज़न एनकोडर के साथ |
| मोडालिटीज | टेक्स्ट, इमेज और टेक्स्ट+इमेज |
| कॉन्टेक्स्ट विंडो | 32k टोकन (ट्रेंड); सैद्धांतिक रूप से 256k तक सपोर्ट |
| हार्डवेयर | एक 16GB NVIDIA GPU पर चल सकता है |
| भाषाएं | अंग्रेजी, फ्रेंच, स्पेनिश, जर्मन, इटालियन, पुर्तगाली, डच, चीनी, जापानी, कोरियाई, अरबी, रूसी |
| आउटपुट | सिंगल-टोकन हां/ना, कंफिडेंस स्कोर के साथ |
| ट्रेनिंग डेटा | ~54.1M क्यूरेटेड और जनरेटेड सैंपल, LoRA फाइन-ट्यूनिंग और SLERP चेकपॉइंट मर्जिंग के ज़रिए |
| लाइसेंस | Apache 2.0 — कमर्शियल और नॉन-कमर्शियल दोनों तरह के इस्तेमाल के लिए ओपन वेट्स |
फिलहाल, मिस्ट्रल ने Shieldstral के अपडेट्स के लिए कोई खास रोडमैप जारी नहीं किया है । हालांकि, इस मॉडल को Open Secure AI Alliance (जिसमें NVIDIA जैसी कंपनियां शामिल हैं) के पहले सदस्य के तौर पर पेश किया गया है । मिस्ट्रल AI का साफ लक्ष्य AI में "फुल-स्टैक प्लेयर" बनना है - चिप्स से लेकर सॉफ्टवेयर एप्लिकेशन तक। इसलिए भविष्य में Shieldstral के बड़े वर्जन, ज़्यादा मोडालिटी के लिए सपोर्ट या मिस्ट्रल के एजेंटिक टूल्स (जैसे Vibe, Forge) के साथ बेहतर इंटीग्रेशन देखने को मिल सकता है । अभी किसी वर्जन या फीचर के समय की कोई घोषणा नहीं की गई है।
Shieldstral को ओपन वेट्स के रूप में Apache 2.0 लाइसेंस के तहत रिलीज़ किया गया है। इसका मतलब है कि कोई भी संगठन इसे बिना किसी कमर्शियल एग्रीमेंट के डाउनलोड कर सकता है और अपने सर्वर पर होस्ट कर सकता है । यह कंटेंट मॉडरेशन के गवर्नेंस को आपके अपने हाथों में दे देता है: आप अपने प्रोडक्ट या ऑडियंस के हिसाब से हार्म टैक्सोनॉमी को बदल सकते हैं, बिना पूरे मॉडल को फिर से ट्रेन किए । इसका इस्तेमाल प्रॉम्प्ट मॉडरेशन, रिस्पॉन्स मॉडरेशन, रिफ्यूज़ल डिटेक्शन और टेक्स्ट-इमेज दोनों के लिए जनरल सेफ्टी फिल्टरिंग में किया जा सकता है ।