Shieldstral嘅做法係將內容對住一條用自然語言寫嘅是非題去評估。每次查詢分三部分:
模型只會做一次前向計算,然後俾一個連續嘅安全分數,用家可以自己set門檻決定安全定唔安全。Mistral建議每次只問一條政策問題;如果有多條政策,就要分開逐條問。
呢個設計令到唔再需要事先Train死一套固定嘅有害分類。Shieldstral可以適應任何用是非題表達嘅政策,令到唔同分類系統嘅安全數據集都可以用同一個訓練框架去處理。
Shieldstral喺文字安全測試上,效能拍得住甚至超越大佢7倍嘅開源守門模型,仲創咗多模態安全分類嘅新紀錄。以下係Mistral公布嘅測試結果:
文字安全分類 — F1 (%)
| 測試基準 | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
多模態安全 — F1 (%)
| 測試基準 | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
總括嚟講,文字安全平均F1係84.9%,多模態安全平均F1係83.8%——比晒所有測試過嘅模型都要高分。喺文字安全方面,Shieldstral嘅84.9%同大佢差不多7倍嘅GPT-OSS-Safeguard-20B打成平手。
| 規格 | 詳情 |
|---|---|
| 參數量 | 38億活躍參數 |
| 基礎模型 | Ministral-3-3B-Base-2512,內置Pixtral視覺編碼器 |
| 模態 | 文字、圖像、文字+圖像 |
| 上下文長度 | 32K tokens(訓練時);理論上支援256K |
| 硬件需求 | 一張16GB NVIDIA GPU就搞得掂 |
| 語言 | 英文、法文、西班牙文、德文、意大利文、葡萄牙文、荷蘭文、中文、日文、韓文、阿拉伯文、俄文 |
| 輸出 | 單一token嘅是非判斷,附帶連續信心分數 |
| 訓練數據 | 約5410萬個經篩選同生成嘅樣本,用LoRA微調同SLERP檢查點合併技術 |
| 授權 | Apache 2.0——開源權重,商用同非商用都得 |
Mistral暫時未有公布Shieldstral 1.0之後嘅具體路線圖。呢個模型係Open Secure AI Alliance(同NVIDIA等公司合作)嘅首個成員,定位為政策適應性安全嘅基礎組件。考慮到Mistral話想做到AI界嘅「full-stack player」——由數據中心嘅晶片到企業軟件應用——未來嘅Shieldstral可能會有大啲嘅規模、支援更多模態,或者同Mistral嘅代理工具(Vibe、Forge)同企業部署方案有更緊密嘅整合。不過暫時未有公布任何版本周期或者具體功能時間表。
由於Shieldstral係開放權重同Apache 2.0授權,任何機構都可以下載同自己host呢個模型,唔使同Mistral簽商業協議。呢個做法將內容審查嘅管治權交返俾用家:團隊可以針對特定用戶群或者應用場景去調整安全分類,而唔使重新訓練個模型,仲可以自己set門檻去配合公司嘅風險接受程度。呢個模型可以用喺提示審查、回應審查、提示-回應配對分類、拒絕檢測,同埋一般嘅文字同圖像安全過濾。