Pendekatan red-teaming otomatis OpenAI didokumentasikan dalam makalahnya 'Diverse and Effective Red Teaming with Auto-generated Rewards' (14 Juli 2026) . Sistem ini memecah masalah red-teaming menjadi dua langkah:
Metode ini menggunakan self-play, di mana penyerang otomatis berbasis LLM menguji model target untuk mencari kelemahan seperti prompt injection dan jailbreak . OpenAI menyatakan bahwa pendekatan bertenaga RL ini membantu menemukan dan menambal eksploitasi secara proaktif sebelum digunakan di dunia nyata . Perusahaan menggambarkan prompt injection sebagai 'tantangan keamanan kelas frontier' dan secara aktif menggunakan red-teaming otomatis untuk mengembangkan serangan prompt injection baru .
Sebelum GPT-5.6 tersedia secara umum, OpenAI menundukkan model tersebut pada periode evaluasi paling ekstensif yang pernah ada . System Card GPT-5.6 Preview menyatakan: 'Kami juga mendedikasikan lebih dari 700.000 jam GPU A100e untuk secara otomatis menemukan jailbreak universal dan kerentanan lainnya' . Pengujian otomatis ini melengkapi red-teaming manusia selama berminggu-minggu dan evaluasi ahli domain eksternal .
Perusahaan mengerahkan anggaran komputasi yang sangat besar ini untuk mencari jailbreak yang umum dan sistemik, bukan hanya kegagalan sempit satu kali . Red-teaming otomatis dirancang untuk berjalan terus menerus bahkan setelah peluncuran, dengan mitigasi dan pengujian ulang diterapkan saat jailbreak baru dilaporkan .
Di bawah Preparedness Framework OpenAI, ketiga varian GPT-5.6 — Sol (flagship), Terra (biaya lebih rendah), dan Luna (tercepat) — diklasifikasikan sebagai 'High' dalam kemampuan keamanan siber dan risiko biologi/kimia . Ini adalah pertama kalinya model yang lebih kecil dan lebih murah pun melewati ambang High untuk kategori-kategori ini .
Namun, tidak ada model yang mencapai ambang 'Critical'. Pengujian keamanan siber internal menemukan bahwa GPT-5.6 Sol dan Terra dapat mengidentifikasi kerentanan dan potongan eksploitasi, tetapi tidak dapat secara otonom melakukan serangan end-to-end yang lengkap . Tidak ada model yang mencapai ambang High untuk kemampuan perbaikan diri AI .
GPT-5.6 hadir dengan apa yang OpenAI gambarkan sebagai 'safeguards paling kuat hingga saat ini' . Arsitektur keamanannya meliputi:
Pendekatan berlapis ini mencerminkan kesimpulan OpenAI bahwa tidak ada satu pun pengaman yang cukup .
Openai secara aktif membangun kapasitas internalnya untuk red-teaming otomatis. Perusahaan sedang merekrut seorang Researcher, Automated Red Teaming (gaji pokok $295K–$445K) yang perannya adalah 'memimpin upaya Automated Red Teaming, berfokus pada membangun sistem berskala untuk mengungkap mode kegagalan dalam model AI dan safeguards' . Perusahaan juga merekrut Biosafety Red Teaming Specialist ($158K–$320K) untuk memimpin upaya red-teaming biosafety dan CBRN .
OpenAI menyelenggarakan Red-Teaming Challenge di Kaggle dengan total hadiah $500.000, berfokus pada model open-weight mereka gpt-oss-120b dan gpt-oss-20b . Kompetisi ini memberi insentif kepada peserta untuk menemukan kerentanan baru yang belum pernah diidentifikasi sebelumnya . Meskipun angka spesifik $500.000 dan detail tantangan tidak dapat diverifikasi secara independen dari sumber resmi OpenAI dalam analisis ini, pemberitaan pihak ketiga dari TechPolicy.Press mengonfirmasi keberadaan kompetisi tersebut . System Card GPT-5.6 menyebutkan 'MLE-Bench Revised,' yang mengevaluasi model pada kompetisi Kaggle, tetapi tidak menyebutkan hadiah $500.000 secara langsung.
Bukti yang tersedia mengonfirmasi bahwa GPT-5.6 hadir dengan tumpukan keamanan multi-lapis dan bahwa preparedness framework OpenAI mengklasifikasikan model mereka sendiri . Liputan pihak ketiga mencatat keterlibatan pemerintah AS dalam konteks 'gatekeeping', di mana pemerintah dapat memengaruhi akses ke model paling canggih . Namun, penyebutan langsung UK AI Safety Institute atau tindakan regulasi AS tertentu tidak ada dalam sumber utama yang di-crawl. Dokumentasi system card OpenAI sendiri membahas klasifikasi keamanan tetapi tidak merinci pengawasan regulasi eksternal di luar Preparedness Framework-nya sendiri .