A abordagem de red teaming automatizado da OpenAI está documentada em seu artigo 'Diverse and Effective Red Teaming with Auto-generated Rewards' (14 de julho de 2026) . O sistema divide o problema em duas etapas:
Este método usa auto-play, onde um atacante automatizado baseado em LLM sonda o modelo alvo em busca de fraquezas como injeção de prompt e jailbreaks . A OpenAI afirmou que essa abordagem impulsionada por RL ajuda a descobrir e corrigir proativamente explorações antes que sejam transformadas em armas no mundo real . A empresa descreveu a injeção de prompt como um 'desafio de segurança de fronteira' e usa ativamente o red teaming automatizado para desenvolver novos ataques de injeção de prompt .
Antes do GPT-5.6 chegar à disponibilidade geral, a OpenAI submeteu o modelo ao seu período de avaliação mais extenso até hoje . O System Card do GPT-5.6 Preview afirma: 'Também dedicamos mais de 700 mil horas de GPU A100e para encontrar automaticamente jailbreaks universais e outras vulnerabilidades' . Esse teste automatizado complementou semanas de red teaming humano e avaliações de especialistas externos .
A empresa implantou esse orçamento massivo de computação para procurar jailbreaks gerais e sistêmicos, em vez de falhas pontuais e isoladas . O red teaming automatizado foi projetado para ser executado continuamente mesmo após a implantação, com mitigações e novos testes aplicados à medida que novos jailbreaks são relatados .
De acordo com o Preparedness Framework da OpenAI, todas as três variantes do GPT-5.6 — Sol (principal), Terra (menor custo) e Luna (mais rápida) — são classificadas como de capacidade 'Alta' tanto em risco cibernético quanto em risco biológico/químico . Esta é a primeira vez que até mesmo os modelos menores e mais baratos ultrapassam o limite 'Alto' para essas categorias .
No entanto, nenhum dos modelos atingiu o limite 'Crítico'. Testes internos de segurança cibernética descobriram que o GPT-5.6 Sol e Terra conseguem identificar vulnerabilidades e partes de explorações, mas não conseguem realizar ataques autônomos completos de ponta a ponta . Nenhum dos modelos atingiu o limite 'Alto' para autoaperfeiçoamento de IA .
O GPT-5.6 é lançado com o que a OpenAI descreve como 'suas salvaguardas mais robustas até hoje' . A arquitetura de segurança inclui:
Essa abordagem em camadas reflete a conclusão da OpenAI de que nenhuma salvaguarda única é suficiente .
A OpenAI está ativamente expandindo sua capacidade interna de red teaming automatizado. A empresa está contratando um Pesquisador de Red Teaming Automatizado (salário base entre US$ 295 mil e US$ 445 mil) cuja função é 'liderar o esforço de Red Teaming Automatizado, com foco na construção de sistemas escaláveis para descobrir modos de falha em modelos de IA e salvaguardas' . A empresa também está recrutando um Especialista em Red Teaming de Biossegurança (US$ 158 mil a US$ 320 mil) para liderar os esforços de red teaming em biossegurança e CBRN .
A OpenAI sediou um Desafio de Red Teaming no Kaggle com um prêmio de US$ 500 mil, focado em seus modelos de pesos abertos gpt-oss-120b e gpt-oss-20b . A competição incentivou os participantes a descobrir vulnerabilidades inéditas não identificadas anteriormente . Embora o valor específico de US$ 500 mil e os detalhes do desafio não tenham sido verificados de forma independente a partir de fontes oficiais da OpenAI nesta análise, relatórios de terceiros do TechPolicy.Press confirmam a existência da competição . O System Card do GPT-5.6 menciona 'MLE-Bench Revised', que avalia modelos em competições do Kaggle, mas não faz referência direta ao prêmio de US$ 500 mil.
As evidências disponíveis confirmam que o GPT-5.6 é lançado com uma pilha de segurança de múltiplas camadas e que o framework de preparação da OpenAI classificou seus próprios modelos . Coberturas de terceiros mencionam o envolvimento do governo dos EUA em um contexto de 'porteiro' (gatekeeping), onde o governo pode influenciar o acesso aos modelos mais capazes . No entanto, menções diretas ao Instituto de Segurança de IA do Reino Unido (UK AI Safety Institute) ou a ações regulatórias específicas dos EUA não estavam presentes nas fontes primárias rastreadas. A própria documentação do system card da OpenAI aborda as classificações de segurança, mas não detalha a supervisão regulatória externa além de seu próprio Preparedness Framework .