OpenAI oppgir at GPT 6 Astra gjør færre faktafeil og er betydelig mer robust mot jailbreaks og prompt injeksjoner enn GPT 5.6 Sol, også i angrep som utvikler seg over flere steg. Gray Swans IPI Arena fant at ingen av de testede modellene var immune mot skjulte prompt injeksjoner.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
GPT-6 Astra er et tydelig sikkerhetsløft sammenlignet med GPT-5.6 Sol, ifølge OpenAIs egne evalueringer. Selskapet sier at Astra gjør færre faktafeil, er mer motstandsdyktig mot prompt-injeksjoner og betydelig mer robust mot jailbreaks – også når angrepet utvikler seg over lengre interaksjoner. 25
30
Den avgjørende begrensningen ligger i hvordan modellen brukes. Bedre modellatferd gjør ikke en KI-agent immun mot fiendtlige instrukser gjemt i nettsider, dokumenter, e-poster, kodebaser eller verktøyresultater den leser. Gray Swans tester av indirekte prompt-injeksjon (IPI) konkluderte med at ingen testet modell var immun. 4
OpenAI oppgir at Astra er betydelig mer robust mot jailbreaks enn GPT-5.6 Sol, også i lengre angrepsforløp. Det er viktig fordi en avansert angriper ikke behøver å lykkes med én åpenbar forespørsel. Angriperen kan tilpasse taktikken gjennom en flertrinnsdialog og forsøke å utnytte kontekst som har bygget seg opp underveis. 25
OpenAI rapporterer også bedre robusthet mot prompt-injeksjoner i nettleser- og arbeidslivslignende situasjoner, i tillegg til færre faktafeil enn Sol. Factualitetsresultatene må likevel tolkes varsomt: Testene av gjengivelse av rapporterte feil tok utgangspunkt i samtaler som brukere allerede hadde flagget som feilaktige. De sier derfor ikke direkte noe om feilraten i vanlig, daglig bruk. 25
30
Dette er reelle forbedringer, særlig for agenter som skal undersøke kilder, skrive kode, bruke nettleser og fullføre oppgaver med flere steg. I lanseringsnotatene beskriver OpenAI Astra som en modell for kompleks, flertrinns arbeidsflyt og for å lage dokumenter, regneark og presentasjoner. 19
Det foreliggende materialet gir ikke grunnlag for å hevde at Astra generelt er sikrere enn Anthropic Claude Opus 5 når det gjelder faktafeil, direkte jailbreaks eller indirekte prompt-injeksjon.
En sammenligning på tvers av modeller krever samme testsett, lik tilgang til verktøy, identiske systeminstruksjoner, en felles definisjon av hva som teller som et vellykket angrep, og angripere med tilsvarende mulighet til å tilpasse seg. Leverandørevalueringer og offentlige red-team-konkurranser kan variere på alle disse punktene. Gray Swan oppgir at Claude Opus 5 er blant modellene i Arena, men de fremlagte resultatene inneholder ikke et direkte Astra-mot-Opus-5-skjema. 1
4
Den mest forsvarlige konklusjonen er derfor smalere: OpenAIs sterkeste dokumentasjon gjelder forbedringen fra GPT-5.6 Sol til Astra.
Et direkte jailbreak starter med en synlig forespørsel fra angriperen til modellen – for eksempel et forsøk på å overstyre reglene eller få modellen til å utføre en forbudt handling. Astras rapporterte forbedringer mot lange angrepsforløp er særlig relevante mot slike utholdende og tilpasningsdyktige angripere. 25
En indirekte prompt-injeksjon kommer derimot gjennom innhold agenten behandler. En skadelig instruks kan ligge skjult i en nettside, e-post, et dokument, et søkeresultat, et kodespor eller et verktøyresultat, og forsøke å vri agenten bort fra brukerens egentlige mål. Gray Swans IPI-utfordring fokuserte nettopp på skjulte instrukser i realistiske miljøer, blant annet nettinnhold, verktøyresultater og spor fra kodeagenter. 5
Det sentrale er at personen som bruker agenten, kanskje aldri ser den skadelige instruksen.
Gray Swan rapporterte resultater fra en IPI Arena med 13 frontmodeller, 464 red-team-deltakere, 41 scenarier og mer enn 272 000 angrepsforsøk. Selskapets konklusjon var at ingen av de testede modellene var immune mot indirekte prompt-injeksjon. 4
Det er et tungtveiende tegn på at IPI fortsatt er et uløst problem ved utrulling av KI-agenter. Samtidig er dette ikke en fullstendig, leverandørnøytral resultatliste for alle sikkerhetsdimensjoner. Resultatet beviser ikke at alle modeller feiler like ofte, og det erstatter heller ikke modellspesifikke tester av factualitet eller motstand mot direkte jailbreaks.
For en frittstående chatassistent kan en vellykket injeksjon ende med et misvisende svar. For en virksomhetsagent som er koblet til forretningssystemer, kan konsekvensene bli langt større.
OpenAI klassifiserer Astra som å ha nådd terskelen Critical for cybersikkerhetskapasitet i sitt Preparedness Framework. Selskapet sier at Astra, med riktige verktøy og tilganger, kan finne tidligere ukjente sikkerhetssvakheter og utvikle metoder for å utnytte dem i mange godt sikrede systemer uten stegvis menneskelig veiledning. 27
Denne kapasiteten kan være verdifull i autorisert forsvarsarbeid. Men den øker også konsekvensene dersom en agentisk arbeidsflyt blir kompromittert: En angriper som klarer å omdirigere agenten gjennom upålitelig innhold, kan forsøke å påvirke hva den søker etter, hvilke verktøy den bruker, eller hvilke handlinger den foreslår. Risikoen øker når agenten har tilgang til sensitive data, kodebaser, skymiljøer, nettleser eller virksomhetsapplikasjoner.
Motstand mot prompt-injeksjon bør behandles som ett forsvarslag – ikke som selve sikkerhetsgrensen. For arbeidsflyter med store konsekvenser bør virksomheter:
OpenAI har selv beskrevet sterkere isolasjon, begrenset nettverks- og verktøytilgang, overvåking og sandkassekjøring som sikkerhetstiltak for mer kapable systemer. 34
De rapporterte reduksjonene i faktafeil og den bedre motstanden mot direkte jailbreaks gjør Astra til en sterkere etterfølger til GPT-5.6 Sol. 25
30 Men det foreliggende materialet gir ikke dekning for å erklære Astra kategorisk sikrere enn Claude Opus 5 i alle situasjoner. Indirekte prompt-injeksjon er dessuten fortsatt en vesentlig svakhet i KI-agenters økosystem.
4
For virksomheter er lærdommen enkel: Velg den sterkeste tilgjengelige modellen, men utform systemet rundt den slik at et ondsinnet dokument eller en nettside ikke kan gjøre modellens kapasitet og tilkoblede verktøy til en kanal under angriperens kontroll.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI oppgir at GPT 6 Astra gjør færre faktafeil og er betydelig mer robust mot jailbreaks og prompt injeksjoner enn GPT 5.6 Sol, også i angrep som utvikler seg over flere steg.
OpenAI oppgir at GPT 6 Astra gjør færre faktafeil og er betydelig mer robust mot jailbreaks og prompt injeksjoner enn GPT 5.6 Sol, også i angrep som utvikler seg over flere steg. Gray Swans IPI Arena fant at ingen av de testede modellene var immune mot skjulte prompt injeksjoner.
Materialet gir ikke et direkte, sammenlignbart grunnlag for å rangere Astra og Anthropic Claude Opus 5 på faktafeil, jailbreak motstand eller indirekte prompt injeksjon.