OpenAI uppger att GPT 6 Astra gör färre faktafel och är betydligt mer motståndskraftig mot jailbreaks och promptinjektioner än GPT 5.6 Sol, även under längre attackförlopp. Gray Swans IPI Arena fann att ingen av de testade modellerna var immun mot dolda promptinjektioner i 13 frontmodeller, 41 agentscenarier och öve...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI:s GPT-6 Astra innebär ett tydligt säkerhetslyft jämfört med GPT-5.6 Sol i företagets egna utvärderingar. Enligt OpenAI gör Astra färre faktafel, står emot promptinjektioner bättre och är betydligt robustare mot jailbreaks – även attacker som utvecklas över längre förlopp. 25
30
Men det finns en avgörande begränsning: bättre modellbeteende gör inte en AI-agent immun mot fientliga instruktioner som göms i webbsidor, dokument, e-post, kodarkiv eller verktygsutdata. Gray Swans tester av indirekta promptinjektioner, IPI, visade att ingen testad modell var immun. 4
OpenAI skriver att Astra är betydligt mer robust mot jailbreaks än GPT-5.6 Sol, även när attackerna sker över längre förlopp. Det är viktigt eftersom en avancerad angripare inte behöver lyckas med en enda uppenbar instruktion. Angriparen kan i stället anpassa sig över flera steg och försöka utnyttja den kontext som byggts upp under interaktionen. 25
OpenAI rapporterar också bättre motståndskraft mot promptinjektioner i miljöer som liknar webbsurfning och arbete, samt färre faktafel än Sol. Resultaten för faktariktighet bör dock tolkas varsamt: testerna med återgivning av rapporterade fel utgår från konversationer som användare redan hade flaggat som felaktiga. De är alltså inte ett mått på en vanlig vardaglig hallucinationsfrekvens. 25
30
Förbättringarna är ändå betydelsefulla, särskilt för agenter som ska söka information, programmera, surfa på webben och slutföra arbetsflöden i flera steg. I OpenAI:s versionsanteckningar beskrivs Astra som en modell för komplexa uppgifter i flera steg och för att skapa dokument, kalkylblad och presentationer. 19
Det tillgängliga underlaget räcker inte för att slå fast att Astra generellt är säkrare än Anthropic Claude Opus 5, vare sig för faktariktighet, direkta jailbreaks eller indirekta promptinjektioner.
En rättvis jämförelse mellan modeller kräver samma testuppsättning, likvärdiga agentverktyg, identiska systeminstruktioner, samma definition av en lyckad attack och angripare med jämförbar möjlighet att anpassa sina angrepp. Leverantörernas egna utvärderingar och offentliga red-team-tävlingar kan skilja sig på samtliga punkter. Gray Swan listar Claude Opus 5 bland modellerna i sin Arena, men de tillhandahållna resultaten innehåller inget direkt och jämförbart resultatkort för Astra mot Opus 5. 1
4
Den försvarbara slutsatsen är därför snävare: OpenAI:s starkaste belägg gäller Astras förbättring jämfört med den egna föregångaren GPT-5.6 Sol.
Ett direkt jailbreak börjar med angriparens synliga begäran till modellen, exempelvis ett försök att köra över regler eller få modellen att utföra en förbjuden handling. Astras rapporterade förbättringar mot längre attackförlopp är särskilt relevanta mot denna typ av ihärdig och anpassningsbar angripare. 25
En indirekt promptinjektion kommer i stället via innehåll som agenten läser eller behandlar. En fientlig instruktion kan vara inbäddad i en webbsida, ett e-postmeddelande, ett dokument, ett sökresultat, ett kodspår eller ett verktygssvar. Syftet är att styra agenten bort från användarens egentliga mål. Gray Swans IPI-utmaning fokuserade just på dolda instruktioner i realistiska miljöer, bland annat webbinnehåll, verktygsutdata och spår från kodagenter. 5
Det centrala är att personen som använder agenten kanske aldrig ens ser den skadliga instruktionen.
Gray Swan redovisade resultat från en IPI Arena med 13 frontmodeller, 464 red team-deltagare, 41 scenarier och över 272 000 attackförsök. Företagets slutsats var att ingen av de testade modellerna var immun mot indirekta promptinjektioner. 4
Det är starka belägg för att IPI fortfarande är ett olöst problem när AI-agenter ska användas i praktiken. Däremot är det inte en komplett, leverantörsoberoende topplista för alla säkerhetsdimensioner. Resultatet innebär inte att alla modeller misslyckas lika ofta, och det ersätter inte modellspecifika utvärderingar av faktariktighet eller motståndskraft mot direkta jailbreaks.
För en fristående chattassistent kan en lyckad injektion leda till ett missvisande svar. För en företagsagent med kopplingar till verksamhetssystem kan följderna bli betydligt större.
OpenAI bedömer att Astra når tröskeln Critical för cybersäkerhetsförmåga i sitt Preparedness Framework. Enligt OpenAI kan Astra, med rätt verktyg och åtkomst, hitta tidigare okända säkerhetsbrister och utveckla sätt att utnyttja dem i många välskyddade system utan mänsklig vägledning i varje steg. 27
Förmågan kan vara värdefull i auktoriserat försvarsarbete. Men den höjer också konsekvenserna om ett agentbaserat arbetsflöde komprometteras: en angripare som styr om agenten genom opålitligt innehåll kan försöka påverka vad den söker efter, vilka verktyg den använder och vilka åtgärder den föreslår. Risken ökar när agenten har åtkomst till känsliga data, kodarkiv, molnmiljöer, webbläsare eller verksamhetsapplikationer.
Se motståndskraft mot promptinjektioner som ett skyddslager, inte som själva säkerhetsgränsen. Vid agentarbetsflöden med stor påverkan bör organisationer:
OpenAI har beskrivit starkare isolering, begränsad nätverks- och verktygsåtkomst, övervakning och sandlådekörning som skydd för mer kapabla system. 34
Astras rapporterade minskning av faktafel och bättre motståndskraft mot direkta jailbreaks gör modellen till en starkare efterföljare till GPT-5.6 Sol. 25
30 Men det finns inget underlag här för att beskriva den som kategoriskt säkrare än Claude Opus 5 i alla situationer. Och indirekta promptinjektioner är fortsatt en påtaglig svaghet i ekosystemet för AI-agenter.
4
För företag är lärdomen enkel: välj en så robust modell som möjligt, men bygg systemet runt den så att ett skadligt dokument eller en webbsida inte kan göra modellens kapacitet och anslutna verktyg till en kanal som angriparen kontrollerar.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI uppger att GPT 6 Astra gör färre faktafel och är betydligt mer motståndskraftig mot jailbreaks och promptinjektioner än GPT 5.6 Sol, även under längre attackförlopp.
OpenAI uppger att GPT 6 Astra gör färre faktafel och är betydligt mer motståndskraftig mot jailbreaks och promptinjektioner än GPT 5.6 Sol, även under längre attackförlopp. Gray Swans IPI Arena fann att ingen av de testade modellerna var immun mot dolda promptinjektioner i 13 frontmodeller, 41 agentscenarier och över 272 000 attackförsök.
Det finns inget jämförbart offentligt underlag i materialet som ger en definitiv rangordning mellan Astra och Anthropic Claude Opus 5 för faktafel eller motståndskraft mot jailbreaks.