Shieldstral 将内容与一条以自然语言是/否问题表达的审核策略进行比较。每个请求包含三个部分 :
模型从一次前向传播中返回一个连续的安全评分,可通过阈值设定来决定是“安全”或“不安全” 。Mistral 建议每次查询只使用一条策略;如需多条策略,则需分别调用 。
这种设计消除了训练时固定有害类别的需求,使 Shieldstral 能够适配任何可以用是/否问题表达的审核策略 。
在文本安全方面,Shieldstral 表现持平或超越多数 7 倍于其大小的开源防护模型 ;在多模态安全方面,它树立了新的最佳水平 。以下数据来自 Mistral 发布的评估结果 :
文本安全分类 — F1 分数 (%)
| 基准 | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
多模态安全 — F1 分数 (%)
| 基准 | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
整体文本安全 F1 分数为 84.9%;多模态安全 F1 分数为 83.8% —— 在所有测试模型中都位居前列 。在文本安全方面,Shieldstral 的 84.9% 与 GPT-OSS-Safeguard-20B(一个几乎 7 倍于其大小的模型)持平 。
| 规格 | 详情 |
|---|---|
| 参数 | 3.8B 活跃参数 |
| 基础模型 | Ministral-3-3B-Base-2512,内置 Pixtral 视觉编码器 |
| 模态 | 文本、图像、文本+图像 |
| 上下文窗口 | 32k tokens(训练时);理论上支持高达 256k |
| 硬件 | 可运行于单张 16GB NVIDIA GPU |
| 语言 | 英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语、阿拉伯语、俄语 |
| 输出 | 单 token 的是/否,附带连续置信度评分 |
| 训练数据 | 约 5410 万个经整理和生成的样本,采用 LoRA 微调和 SLERP 检查点合并 |
| 许可证 | Apache 2.0 —— 开源权重,可用于商业和非商业用途 |
Mistral 尚未公布 Shieldstral 1.0 以外的具体路线图。该模型被定位为 Open Secure AI Alliance(与 NVIDIA 等共同发起)的首批成员,也是策略自适应安全的基础构建模块 。考虑到 Mistral 此前表达的“全栈玩家”野心——从数据中心的芯片到软件应用——未来的 Shieldstral 版本可能会扩大规模、支持更多模态,或与 Mistral 的智能体工具(Vibe、Forge)及企业部署栈进行更紧密的集成 。目前尚未公布任何版本节奏或具体功能时间表。
由于 Shieldstral 采用开源权重和 Apache 2.0 许可证发布,任何组织都可以下载并自行托管,无需与 Mistral 签订商业协议 。这使内容审核的治理权转移到了组织内部:团队可以根据特定受众或部署环境调整有害类别,而无需重新训练底层模型;也可以通过调整安全评分阈值来匹配自身的风险承受能力 。该模型设计用于提示词审核、回复审核、提示词-回复对分类、拒答检测以及文本和图像输入的一般安全过滤 。