OpenAI:n automaattinen punatiimimenetelmä on dokumentoitu paperissa 'Diverse and Effective Red Teaming with Auto-generated Rewards' (14. heinäkuuta 2026) . Järjestelmä jakaa punatiimityön kahteen vaiheeseen:
Tämä menetelmä käyttää itseoppimista, jossa LLM-pohjainen automaattinen hyökkääjä etsii kohdemallista heikkouksia, kuten prompt injection -hyökkäyksiä ja jailbreakkeja . OpenAI on todennut, että tämä RL-pohjainen lähestymistapa auttaa havaitsemaan ja korjaamaan haavoittuvuuksia ennen kuin niitä ehditään aseistaa . Yhtiö on kuvannut prompt injection -hyökkäyksiä 'rajaturvallisuuden haasteeksi' ja käyttää automaattista punatiimityötä kehittääkseen uusia hyökkäysmenetelmiä .
Ennen GPT-5.6:n julkaisua OpenAI altisti mallin laajimmalle arviointijaksolleen . GPT-5.6 Preview System Card -kortissa todetaan: 'Olemme käyttäneet yli 700 000 A100e GPU-tuntia automaattisesti etsiäksemme universaaleja jailbreakkeja ja muita haavoittuvuuksia' . Tämä automaattinen testaus täydensi viikkoja kestänyttä ihmisten tekemää punatiimityötä ja ulkopuolisten asiantuntijoiden arvioita .
Yhtiö käytti tätä massiivista laskentatehoa etsiäkseen yleisiä, systeemisiä jailbreakkeja eikä vain kapeita, yksittäisiä vikoja . Automaattinen punatiimityö on suunniteltu jatkuvasti käynnissä olevaksi myös julkaisun jälkeen, ja korjaavat toimenpiteet tehdään aina uusien jailbreakkien ilmetessä .
OpenAI:n valmiuskehyksen mukaan kaikki kolme GPT-5.6-mallia – Sol (lippulaiva), Terra (edullisempi) ja Luna (nopein) – luokitellaan 'korkean' kyvykkyyden tasolle sekä kyberturvallisuudessa että biologisessa/kemiallisessa riskissä . Tämä on ensimmäinen kerta, kun jopa pienemmät ja halvemmat mallit ylittävät korkean kyvykkyyden kynnyksen näissä luokissa .
Mikään malleista ei kuitenkaan yltänyt 'kriittiselle' tasolle. Sisäisessä kyberturvallisuustestauksessa havaittiin, että GPT-5.6 Sol ja Terra pystyivät tunnistamaan haavoittuvuuksia ja hyökkäysten osia, mutta ne eivät kyenneet suorittamaan autonomisia, täydellisiä hyökkäyksiä . Mikään malleista ei saavuttanut korkean kyvykkyyden tasoa tekoälyn itseparantamisessa .
GPT-5.6 toimitetaan OpenAI:n mukaan 'sen tähän mennessä vankimpien turvatoimien' kanssa . Turvallisuusarkkitehtuuriin kuuluvat:
Tämä kerroksellinen lähestymistapa heijastaa OpenAI:n johtopäätöstä, ettei yksikään yksittäinen turvatoimi ole riittävä .
OpenAI rekrytoi aktiivisesti automaattisen punatiimityön osaajia. Yhtiö etsii tutkijaa (Automaattinen punatiimityö, peruspalkka 295 000–445 000 dollaria), jonka tehtävänä on 'johtaa automaattista punatiimityötä keskittyen skaalautuvien järjestelmien rakentamiseen AI-mallien ja turvatoimien vikatilojen paljastamiseksi' . Yhtiö palkkaa myös bioturvallisuuden punatiimityön erikoisasiantuntijaa (158 000–320 000 dollaria) johtamaan bioturvallisuuden ja CBRN-punatiimityötä .
OpenAI järjesti Kaggle-alustalla punatiimihaasteen, jonka palkintosumma oli 500 000 dollaria, ja joka keskittyi sen avoimen painon malleihin gpt-oss-120b ja gpt-oss-20b . Kilpailu kannusti osallistujia löytämään uusia haavoittuvuuksia, joita ei ollut aiemmin tunnistettu . Vaikka tarkkaa 500 000 dollarin summaa ja haasteen yksityiskohtia ei voitu vahvistaa suoraan OpenAI:n virallisista lähteistä tässä analyysissä, TechPolicy.Pressin kolmannen osapuolen raportointi vahvistaa kilpailun olemassaolon . GPT-5.6:n järjestelmäkortti mainitsee 'MLE-Bench Revised' -arvioinnin, joka testaa malleja Kaggle-kilpailuissa, mutta ei suoraan viittaa 500 000 dollarin palkintoon.
Käytettävissä oleva näyttö vahvistaa, että GPT-5.6 toimitetaan monikerroksisen turvallisuuspinon kanssa ja että OpenAI:n valmiuskehys luokittelee sen omat mallit . Kolmannen osapuolen uutisointi mainitsee Yhdysvaltain hallituksen osallistumisen 'portinvartijan' roolissa, jossa hallitus saattaa vaikuttaa pääsyyn kaikkein kyvykkäimpiin malleihin . Suoria mainintoja Britannian AI-turvallisuusinstituutista tai Yhdysvaltain sääntelytoimista ei kuitenkaan löytynyt indeksoiduista ensisijaisista lähteistä. OpenAI:n oma järjestelmäkorttidokumentaatio käsittelee turvallisuusluokituksia, mutta ei kerro ulkoisesta sääntelyvalvonnasta oman valmiuskehyksensä ulkopuolella .