Shieldstral จะประเมินเนื้อหาตามนโยบายที่แสดงเป็นคำถามใช่/ไม่ใช่ในภาษาธรรมดา คำขอหนึ่งประกอบด้วยสามส่วน :
โมเดลจะส่งกลับค่าคะแนนความปลอดภัยแบบต่อเนื่อง (continuous safety score) เพียงค่าเดียวจากการ forward pass เพียงครั้งเดียว ซึ่งสามารถตั้งค่า threshold เพื่อตัดสินใจแบบปลอดภัย/ไม่ปลอดภัยแบบไบนารี Mistral แนะนำให้ใช้นโยบายหนึ่งข้อต่อหนึ่งคำขอ หากมีหลายนโยบาย จะต้องเรียกใช้โมเดลแยกกันในแต่ละนโยบาย
การออกแบบนี้ช่วยลดความจำเป็นในการมีหมวดหมู่ความอันตรายที่ตายตัวซึ่งถูกฝังไว้ระหว่างการฝึกอบรม โดย Shieldstral สามารถปรับให้เข้ากับนโยบายใดๆ ที่นักพัฒนาสามารถแสดงเป็นคำถามใช่/ไม่ใช่ ซึ่งทำให้สามารถรวมชุดข้อมูลความปลอดภัยที่หลากหลายซึ่งสร้างขึ้นจากระบบหมวดหมู่ที่แตกต่างกันเข้าไว้ในกรอบการฝึกอบรมเดียว
Shieldstral มีประสิทธิภาพเทียบเท่าหรือดีกว่าโมเดล guard แบบเปิดขนาดใหญ่ถึง 7 เท่าในการวัดด้วยข้อความ และสร้างมาตรฐานใหม่ในด้านความปลอดภัยแบบมัลติโมดัล ผลลัพธ์ต่อไปนี้มาจากการประเมินที่เผยแพร่โดย Mistral :
การจำแนกความปลอดภัยของข้อความ — F1 (%)
| มาตรวัด | Shieldstral-3B | GPT-OSS-Safeguard-20B | Qwen3Guard-8B | LlamaGuard-4-12B |
|---|---|---|---|---|
| WildGuardTest | 88.1 | 87.3 | 88.2 | 74.3 |
| ToxicChat | 84.1 | 79.8 | 75.6 | 51.0 |
| Aegis v2 | 86.2 | 84.4 | 84.6 | 71.5 |
| HarmBench | 99.4 | 94.5 | 99.3 | 97.9 |
การจำแนกความปลอดภัยแบบมัลติโมดัล — F1 (%)
| มาตรวัด | Shieldstral-3B | OmniGuard-7B | LlavaGuard-7B | LlamaGuard-4-12B |
|---|---|---|---|---|
| VLGuard | 97.7 | 88.5 | 69.5 | 59.9 |
| UnsafeBench | 81.8 | 72.6 | 63.9 | 30.8 |
ค่า F1 โดยรวมด้านความปลอดภัยของข้อความ: 84.9%; ด้านความปลอดภัยแบบมัลติโมดัล: 83.8% — เหนือกว่าโมเดลอื่นๆ ทั้งหมดที่ทำการทดสอบ ในด้านความปลอดภัยของข้อความ Shieldstral ทำคะแนน 84.9% เท่ากับ GPT-OSS-Safeguard-20B ซึ่งเป็นโมเดลที่มีขนาดใหญ่กว่าเกือบ 7 เท่า
| ข้อมูลจำเพาะ | รายละเอียด |
|---|---|
| พารามิเตอร์ | 3.8B ที่ทำงานจริง |
| โมเดลฐาน | Ministral-3-3B-Base-2512 พร้อมตัวเข้ารหัสภาพ (vision encoder) Pixtral ในตัว |
| รูปแบบข้อมูล | ข้อความ, รูปภาพ, และข้อความ+รูปภาพ |
| หน้าต่างบริบท | 32k token (ที่ใช้ในการฝึก); ในทางทฤษฎีรองรับได้สูงสุดถึง 256k |
| ฮาร์ดแวร์ | ทำงานบน GPU NVIDIA ขนาด 16GB เพียงตัวเดียว |
| ภาษา | อังกฤษ, ฝรั่งเศส, สเปน, เยอรมัน, อิตาลี, โปรตุเกส, ดัตช์, จีน, ญี่ปุ่น, เกาหลี, อาหรับ, รัสเซีย |
| ผลลัพธ์ | ใช่/ไม่ใช่ single-token พร้อมคะแนนความเชื่อมั่นแบบต่อเนื่อง |
| ข้อมูลฝึกอบรม | ตัวอย่างประมาณ 54.1M ชุด ที่ได้รับการคัดสรรและสร้างขึ้น โดยใช้ LoRA fine-tuning และ SLERP checkpoint merging |
| สัญญาอนุญาต | Apache 2.0 — open-weights สำหรับการใช้งานเชิงพาณิชย์และไม่ใช่เชิงพาณิชย์ |
Mistral ยังไม่ได้เผยแพร่แผนงานที่ชัดเจน สำหรับ Shieldstral หลังจากเวอร์ชัน 1.0 โมเดลนี้ถูกวางตำแหน่งให้เป็นสมาชิกรุ่นแรกของ Open Secure AI Alliance (ร่วมกับ NVIDIA และอื่นๆ) และเป็นรากฐานสำคัญสำหรับความปลอดภัยที่ปรับตามนโยบาย ด้วยความทะเยอทะยานที่ Mistral ประกาศไว้ว่าต้องการเป็น "ผู้เล่นแบบ full-stack" ในวงการ AI ตั้งแต่ชิปในดาต้าเซ็นเตอร์ไปจนถึงซอฟต์แวร์แอปพลิเคชัน Shieldstral ในอนาคตอาจมีขนาดใหญ่ขึ้น รองรับรูปแบบข้อมูลที่หลากหลายมากขึ้น หรือผสานรวมกับเครื่องมือ agentic ของ Mistral (Vibe, Forge) และระบบการปรับใช้สำหรับองค์กร ยังไม่มีการประกาศรอบเวอร์ชันหรือไทม์ไลน์คุณสมบัติเฉพาะใดๆ
เนื่องจาก Shieldstral เปิดให้น้ำหนักโมเดล (open weights) ภายใต้สัญญาอนุญาต Apache 2.0 องค์กรใดก็ตามสามารถดาวน์โหลดและติดตั้งโมเดลนี้บนเซิร์ฟเวอร์ของตนเองได้ โดยไม่ต้องมีข้อตกลงทางการค้ากับ Mistral ซึ่งทำให้การกำกับดูแลการคัดกรองเนื้อหากลายเป็นเรื่องภายในองค์กร: ทีมงานสามารถปรับเปลี่ยนหมวดหมู่ความอันตรายให้เหมาะกับกลุ่มผู้ชมหรือบริบทการใช้งานเฉพาะ โดยไม่ต้องฝึกโมเดลใหม่ และสามารถกำหนดระดับ threshold ของคะแนนความปลอดภัยให้สอดคล้องกับระดับความเสี่ยงที่ตนเองยอมรับได้ โมเดลนี้ถูกออกแบบมาสำหรับการคัดกรอง prompt, การคัดกรอง response, การจำแนกประเภทคู่ prompt-response, การตรวจจับการปฏิเสธ (refusal detection), และการกรองความปลอดภัยทั่วไปสำหรับข้อมูลที่เป็นข้อความและรูปภาพ