OpenAI का ऑटोमेटेड रेड-टीमिंग दृष्टिकोण 'Diverse and Effective Red Teaming with Auto-generated Rewards' (14 जुलाई, 2026) नामक पेपर में प्रलेखित है । यह सिस्टम रेड-टीमिंग समस्या को दो चरणों में विभाजित करता है:
यह विधि सेल्फ-प्ले का उपयोग करती है, जहाँ एक LLM-आधारित ऑटोमेटेड अटैकर टार्गेट मॉडल में प्रॉम्प्ट इंजेक्शन और जेलब्रेक जैसी कमज़ोरियाँ खोजता है । OpenAI का कहना है कि RL-संचालित यह दृष्टिकोण सक्रिय रूप से एक्सप्लॉइट्स को खोजने और उन्हें ठीक करने में मदद करता है, इससे पहले कि उनका इस्तेमाल किया जा सके । कंपनी प्रॉम्प्ट इंजेक्शन को एक 'सीमावर्ती सुरक्षा चुनौती' बताती है और नए प्रॉम्प्ट इंजेक्शन अटैक विकसित करने के लिए ऑटोमेटेड रेड-टीमिंग का सक्रिय रूप से उपयोग करती है ।
GPT-5.6 के सामान्य उपलब्धता (GA) में आने से पहले, OpenAI ने मॉडल को अब तक की सबसे व्यापक मूल्यांकन अवधि के अधीन किया । GPT-5.6 प्रीव्यू सिस्टम कार्ड में कहा गया है: 'हमने स्वचालित रूप से यूनिवर्सल जेलब्रेक और अन्य कमज़ोरियाँ खोजने के लिए 7,00,000 A100e GPU घंटे से अधिक समर्पित किए हैं' । यह स्वचालित परीक्षण हफ्तों के मानव रेड-टीमिंग और बाहरी डोमेन-विशेषज्ञ मूल्यांकनों का पूरक था ।
OpenAI के प्रिपेयर्डनेस फ्रेमवर्क के तहत, GPT-5.6 के तीनों वेरिएंट्स - Sol (फ्लैगशिप), Terra (कम लागत) और Luna (सबसे तेज़) - को साइबर सुरक्षा और जैविक/रासायनिक जोखिम दोनों में 'हाई' क्षमता वाला वर्गीकृत किया गया है । यह पहली बार है जब छोटे, सस्ते मॉडल भी इन श्रेणियों के लिए 'हाई' सीमा को पार कर गए हैं । हालांकि, कोई भी मॉडल 'क्रिटिकल' सीमा तक नहीं पहुँचा ।
GPT-5.6 OpenAI के अब तक के 'सबसे मजबूत सुरक्षा उपायों' के साथ आता है । इस सुरक्षा आर्किटेक्चर में शामिल हैं:
OpenAI अपनी ऑटोमेटेड रेड-टीमिंग क्षमताओं का विस्तार कर रहा है। कंपनी एक 'Researcher, Automated Red Teaming' (आधार वेतन $295K–$445K) की भर्ती कर रही है ।
OpenAI ने अपने ओपन-वेट मॉडल gpt-oss-120b और gpt-oss-20b के लिए Kaggle पर $500,000 के पुरस्कार पूल के साथ एक रेड-टीमिंग चैलेंज की मेज़बानी की । यह प्रतियोगिता प्रतिभागियों को पहले से अज्ञात कमज़ोरियाँ खोजने के लिए प्रोत्साहित करती है ।