OpenAI oplyser, at GPT 6 Astra laver færre faktuelle fejl og er markant mere modstandsdygtig over for jailbreaks og prompt injektioner end GPT 5.6 Sol – også i længere angrebsforløb. Gray Swans IPI Arena fandt, at ingen af de testede modeller var immun over for skjulte prompt injektioner på tværs af 13 frontier mode...
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI's GPT-6 Astra er ifølge virksomhedens egne evalueringer et tydeligt sikkerhedsløft i forhold til GPT-5.6 Sol: Modellen skal lave færre faktuelle fejl, være mere modstandsdygtig over for prompt-injektioner og være væsentligt sværere at jailbreake – også når angrebet udvikler sig over mange trin. 25
30
Men forbedret modeladfærd er ikke det samme som immunitet. En AI-agent kan stadig møde fjendtlige instruktioner, der er gemt i de websider, dokumenter, e-mails, kodearkiver eller værktøjsoutput, den læser. Gray Swans test af indirekte prompt-injektioner, IPI, fandt ingen immun model blandt dem, virksomheden testede. 4
OpenAI skriver, at Astra er markant mere robust over for jailbreaks end GPT-5.6 Sol, herunder angreb over længere forløb. Det er vigtigt, fordi en målrettet angriber ikke behøver nøjes med én åbenlys instruktion: Vedkommende kan løbende tilpasse angrebet i en samtale og forsøge at udnytte den kontekst, der samler sig undervejs. 25
OpenAI rapporterer også bedre modstandsdygtighed mod prompt-injektioner i browsing- og arbejdslignende situationer samt færre faktuelle fejl end Sol. Sammenligningerne af faktuelle fejl skal dog læses med et vigtigt forbehold: Testene af reproducerede fejl tager udgangspunkt i ChatGPT-samtaler, som brugere allerede havde markeret som forkerte. De må derfor ikke opfattes som en almindelig fejlrate i hverdagsbrug. 25
30
Forbedringerne er særligt relevante for agenter, der skal researche, programmere, browse og løse flertrinsopgaver. Ifølge OpenAI's udgivelsesnoter kan Astra håndtere komplekst arbejde over flere trin og producere dokumenter, regneark og præsentationer. 19
Det foreliggende materiale understøtter ikke en generel påstand om, at Astra er sikrere end Anthropic Claude Opus 5 på faktuel korrekthed, direkte jailbreaks eller indirekte prompt-injektioner.
En retfærdig sammenligning på tværs af modeller kræver samme testdatasæt, ens agentværktøjer, identiske systeminstruktioner, fælles definition af et vellykket angreb og angribere med tilsvarende mulighed for at tilpasse sig. Leverandørernes egne evalueringer og offentlige red-team-udfordringer kan variere på alle disse punkter. Gray Swan nævner Claude Opus 5 blandt modellerne i sin Arena, men de leverede resultater indeholder ikke et direkte, sammenligneligt scorekort for Astra mod Opus 5. 1
4
Den holdbare konklusion er derfor mere snæver: OpenAI's stærkeste dokumentation gælder Astras forbedring i forhold til virksomhedens egen forgænger, GPT-5.6 Sol.
Et direkte jailbreak starter med en synlig besked fra angriberen til modellen – for eksempel et forsøg på at tilsidesætte dens regler eller få den til at udføre en forbudt handling. Astras rapporterede fremskridt mod lange angrebsforløb er især relevante over for denne type vedholdende og adaptiv modstander. 25
En indirekte prompt-injektion kommer derimod gennem indhold, som agenten selv behandler. En fjendtlig instruktion kan være skjult i en webside, e-mail, et dokument, et søgeresultat, et kodningsspor eller output fra et værktøj. Formålet er at få agenten væk fra brugerens egentlige mål. Gray Swans IPI-udfordring fokuserede netop på skjulte prompts i realistiske miljøer, herunder webindhold, værktøjsoutput og spor fra kodningsagenter. 5
Det afgørende er, at den person, der bruger agenten, måske slet ikke ser den skadelige instruktion.
Gray Swan rapporterede resultater fra en IPI Arena med 13 frontier-modeller, 464 red teamere, 41 scenarier og mere end 272.000 angrebsforsøg. Virksomhedens konklusion var, at ingen af de testede modeller var immune over for indirekte prompt-injektioner. 4
Det er stærk dokumentation for, at IPI fortsat er et uløst problem ved implementering af AI-agenter. Men testen er ikke en komplet, leverandørneutral rangliste over alle sikkerhedsdimensioner. Resultatet beviser hverken, at alle modeller fejler lige ofte, eller erstatter modelspecifikke vurderinger af faktuel korrekthed og modstandsdygtighed mod direkte jailbreaks.
For en fritstående chatassistent kan en vellykket injektion ende med et misvisende svar. For en virksomhedsagent med adgang til interne systemer kan konsekvenserne være langt større.
OpenAI vurderer, at Astra når tærsklen Critical for cybersikkerhedskapacitet i virksomhedens Preparedness Framework. Ifølge OpenAI kan Astra – med de rette værktøjer og adgange – finde hidtil ukendte sikkerhedssvagheder og udvikle metoder til at udnytte dem på tværs af mange godt beskyttede systemer uden trinvis menneskelig vejledning. 27
Evnen kan være værdifuld i autoriseret forsvarsarbejde. Men den øger også konsekvensen, hvis en agentisk arbejdsgang kompromitteres: En angriber, der kan omdirigere agenten via utroværdigt indhold, kan forsøge at påvirke, hvad den søger efter, hvilke værktøjer den kalder, og hvilke handlinger den foreslår. Risikoen vokser, når agenten har adgang til følsomme data, kodearkiver, cloudmiljøer, browsere eller forretningsapplikationer.
Modstandsdygtighed mod prompt-injektioner bør betragtes som ét forsvarslag – ikke som selve sikkerhedsgrænsen. Ved AI-agenter i arbejdsgange med stor konsekvens bør organisationer:
OpenAI har selv fremhævet stærkere isolation, begrænset netværks- og værktøjsadgang, overvågning og sandkasseeksekvering som sikkerhedsforanstaltninger for mere kapable systemer. 34
Astras rapporterede fald i faktuelle fejl og bedre modstandsdygtighed mod direkte jailbreaks gør den til en stærkere efterfølger til GPT-5.6 Sol. 25
30 Men intet i det leverede materiale berettiger til at kalde den kategorisk sikrere end Claude Opus 5 i alle situationer, og indirekte prompt-injektioner er fortsat en væsentlig svaghed i AI-agenters økosystem.
4
For virksomheder er den praktiske lære enkel: Vælg den stærkeste tilgængelige model, men byg systemet, så et ondsindet dokument eller en webside ikke kan gøre modellens kapacitet og tilkoblede værktøjer til en kanal, angriberen kontrollerer.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI oplyser, at GPT 6 Astra laver færre faktuelle fejl og er markant mere modstandsdygtig over for jailbreaks og prompt injektioner end GPT 5.6 Sol – også i længere angrebsforløb.
OpenAI oplyser, at GPT 6 Astra laver færre faktuelle fejl og er markant mere modstandsdygtig over for jailbreaks og prompt injektioner end GPT 5.6 Sol – også i længere angrebsforløb. Gray Swans IPI Arena fandt, at ingen af de testede modeller var immun over for skjulte prompt injektioner på tværs af 13 frontier modeller, 41 agentscenarier og mere end 272.000 angrebsforsøg.
Det tilgængelige materiale giver ikke grundlag for en endelig, direkte rangordning af Astra og Anthropic Claude Opus 5 på faktuelle fejl eller modstandsdygtighed mod jailbreaks.