Shieldstral arvioi sisällön käytäntöä vasten, joka ilmaistaan luonnollisen kielen kyllä/ei-kysymyksenä. Pyyntö koostuu kolmesta osasta :
Malli palauttaa yhden jatkuvan turvallisuuspistemäärän yhdellä läpimenolla, ja sitä voidaan kynnystää binääristä turvallinen/turvaton-päätöstä varten . Mistral suosittelee yhtä käytäntöä per kysely; useita käytäntöjä varten jokainen saa oman päättelykutsunsa .
Tämä suunnittelu poistaa tarpeen kiinteälle harmitaksonomialle, joka on upotettu malliin koulutusvaiheessa. Shieldstral mukautuu mihin tahansa käytäntöön, jonka kehittäjä osaa ilmaista kyllä/ei-kysymyksenä – mikä mahdollistaa eri taksonomioihin rakennettujen turvallisuusdatasettien yhdistämisen yhteen koulutuskehykseen .
Shieldstral yltää samoihin tai parempiin tuloksiin kuin jopa 7 kertaa suuremmat avoimet turvamallit tekstin turvallisuudessa ja asettaa uuden tason monimuotoisessa turvallisuudessa . Seuraavat tulokset ovat Mistralin julkaisemista arvioista :
Tekstin turvallisuusluokittelu – F1 (%)
| Testi | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
Monimuotoinen turvallisuus – F1 (%)
| Testi | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Kokonaistekstin turvallisuuden F1: 84,9 %; monimuotoisen turvallisuuden F1: 83,8 % – parempi kuin jokainen testattu malli . Tekstin turvallisuudessa Shieldstralin 84,9 % on tasoissa GPT-OSS-Safeguard-20B:n kanssa, joka on malli lähes 7 kertaa suurempi .
| Ominaisuus | Yksityiskohta |
|---|---|
| Parametrit | 3,8 miljardia aktiivista |
| Pohjamalli | Ministral-3-3B-Base-2512 omalla Pixtral-näönkooderilla |
| Modaliteetit | Teksti, kuva sekä teksti+kuva |
| Konteksti-ikkuna | 32 000 tokenia (koulutettu); teoriassa jopa 256 000 |
| Laitteisto | Toimii yhdellä 16 Gt:n NVIDIA-näytönohjaimella |
| Kielet | Englanti, ranska, espanja, saksa, italia, portugali, hollanti, kiina, japani, korea, arabia, venäjä |
| Tuloste | Yksi token kyllä/ei jatkuvalla luottamuspistemäärällä |
| Koulutusdata | ~54,1 miljoonaa kuratoitua ja tuotettua näytettä käyttäen LoRA-hienosäätöä ja SLERP-tarkistuspisteiden yhdistämistä |
| Lisenssi | Apache 2.0 – avoimet painot kaupalliseen ja ei-kaupalliseen käyttöön |
Mistral ei ole julkaissut erityistä tiekarttaa Shieldstralille 1.0-julkaisun jälkeen. Malli on asemoitu Open Secure AI Alliance -allianssin (NVIDIAn ja muiden kanssa) perustajajäseneksi ja käytäntöön mukautuvan turvallisuuden perusrakennuspalikaksi . Ottaen huomioon Mistralin ilmoitetun tavoitteen olla "täyspino-pelaaja" tekoälyssä – piireistä datakeskuksissa ohjelmistosovelluksiin – Shieldstralin tulevat versiot voisivat olla suurempia, tukea laajempia modaliteetteja tai integroitua tiiviimmin Mistralin agenttityökaluihin (Vibe, Forge) ja yrityskäyttöön tarkoitettuun pinon . Versioaikataulua tai erityistä ominaisuuksien aikajanaa ei ole ilmoitettu.
Koska Shieldstral on julkaistu avoimilla painoilla Apache 2.0 -lisenssillä, mikä tahansa organisaatio voi ladata ja isännöidä mallin itse ilman kaupallista sopimusta Mistralin kanssa . Tämä siirtää sisällönmoderoinnin hallinnan organisaation omiin käsiin: tiimit voivat mukauttaa harmitaksonomioita tiettyihin yleisöihin tai käyttötilanteisiin ilman taustamallin uudelleenkoulutusta, ja he voivat kynnyttää turvallisuuspistemääriä oman riskinsietokykynsä mukaan . Malli on suunniteltu kehotteiden moderointiin, vastausten moderointiin, kehote-vastaus-parien luokitteluun, kieltäytymisen havaitsemiseen ja yleiseen turvallisuussuodatukseen teksti- ja kuvasyötteiden välillä .