Shieldstral đánh giá nội dung dựa trên một chính sách được thể hiện dưới dạng câu hỏi có/không bằng ngôn ngữ tự nhiên. Một yêu cầu bao gồm ba phần :
Mô hình trả về một điểm số an toàn liên tục duy nhất từ một lần truyền xuôi. Điểm số này có thể được so sánh với một ngưỡng để đưa ra quyết định an toàn/không an toàn nhị phân . Mistral khuyến nghị sử dụng một chính sách cho mỗi truy vấn; nếu có nhiều chính sách, mỗi chính sách sẽ cần một lần gọi suy luận riêng
.
Thiết kế này loại bỏ nhu cầu phải có một hệ thống phân loại tác hại cố định được tích hợp trong quá trình huấn luyện. Thay vào đó, Shieldstral thích ứng với bất kỳ chính sách nào mà nhà phát triển có thể diễn đạt dưới dạng câu hỏi có/không — giúp hợp nhất các tập dữ liệu an toàn đa dạng được xây dựng trên các hệ thống phân loại khác nhau vào một khung huấn luyện duy nhất .
Shieldstral đạt kết quả ngang bằng hoặc vượt trội so với các mô hình bảo vệ mã nguồn mở lớn gấp 7 lần về kích thước trong các bài kiểm tra an toàn văn bản và thiết lập một tiêu chuẩn mới cho an toàn đa phương thức . Dưới đây là các kết quả từ đánh giá được công bố của Mistral
:
Phân loại an toàn văn bản — F1 (%)
| Chuẩn mực | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88,1 | 87,3 | 88,2 | 74,3 |
| ToxicChat | 84,1 | 79,8 | 75,6 | 51,0 |
| Aegis v2 | 86,2 | 84,4 | 84,6 | 71,5 |
| HarmBench | 99,4 | 94,5 | 99,3 | 97,9 |
An toàn đa phương thức — F1 (%)
| Chuẩn mực | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97,7 | 88,5 | 69,5 | 59,9 |
| UnsafeBench | 81,8 | 72,6 | 63,9 | 30,8 |
Điểm F1 tổng thể cho an toàn văn bản là 84,9%; cho an toàn đa phương thức là 83,8% — cao hơn tất cả các mô hình được thử nghiệm . Về an toàn văn bản, Shieldstral với 84,9% ngang bằng với GPT-OSS-Safeguard-20B, một mô hình lớn gần gấp 7 lần
.
Mistral chưa công bố lộ trình cụ thể nào cho Shieldstral ngoài bản phát hành 1.0. Mô hình này được định vị là thành viên sáng lập của Open Secure AI Alliance (cùng với NVIDIA và các đối tác khác) và là một khối xây dựng nền tảng cho an toàn thích ứng với chính sách . Với tham vọng đã được khẳng định là trở thành một "người chơi full-stack" trong lĩnh vực AI — từ chip trong trung tâm dữ liệu đến các ứng dụng phần mềm — các phiên bản tương lai của Shieldstral có thể sẽ có quy mô lớn hơn, hỗ trợ nhiều phương thức hơn hoặc tích hợp chặt chẽ hơn với các công cụ agent của Mistral (Vibe, Forge) và ngăn xếp triển khai doanh nghiệp
. Hiện chưa có nhịp độ phát hành phiên bản hoặc mốc thời gian tính năng cụ thể nào được công bố.
Vì Shieldstral được phát hành dưới dạng trọng số mở với giấy phép Apache 2.0, bất kỳ tổ chức nào cũng có thể tải xuống và tự lưu trữ mô hình mà không cần thỏa thuận thương mại với Mistral . Điều này đưa quyền quản trị kiểm duyệt nội dung vào nội bộ: các nhóm có thể điều chỉnh các hệ thống phân loại tác hại cho phù hợp với đối tượng hoặc bối cảnh triển khai cụ thể mà không cần huấn luyện lại mô hình cơ bản và họ có thể đặt ngưỡng điểm số an toàn để phù hợp với mức độ chấp nhận rủi ro của riêng mình
. Mô hình được thiết kế cho các tác vụ: kiểm duyệt prompt, kiểm duyệt phản hồi, phân loại cặp prompt-phản hồi, phát hiện từ chối và lọc an toàn tổng quát trên cả đầu vào văn bản và hình ảnh
.