OpenAI stelt dat GPT 6 Astra minder feitelijke fouten maakt en aanzienlijk beter bestand is tegen jailbreaks en promptinjecties dan GPT 5.6 Sol, ook bij langere aanvalstrajecten. In Gray Swans IPI Arena bleek geen van de geteste modellen immuun voor verborgen promptinjecties; de test omvatte 13 frontiermodellen, 41...
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI’s GPT-6 Astra is volgens de eigen evaluaties van het bedrijf een duidelijke veiligheidsverbetering ten opzichte van GPT-5.6 Sol. Astra zou minder feitelijke fouten maken, beter omgaan met promptinjecties en aanzienlijk beter bestand zijn tegen jailbreaks, ook wanneer een aanval zich over een langere reeks interacties uitstrekt. 25
30
De belangrijke kanttekening zit in de manier waarop het model wordt ingezet. Betere modelbescherming maakt een AI-agent niet immuun voor kwaadaardige instructies die verborgen staan in webpagina’s, documenten, e-mails, code-repositories of tooluitvoer. Uit tests van Gray Swan rond indirecte promptinjecties bleek dat geen enkel getest model volledig immuun was. 4
OpenAI zegt dat Astra aanzienlijk robuuster is tegen jailbreaks dan GPT-5.6 Sol, ook bij langere aanvalstrajecten. Dat is relevant omdat een geavanceerde aanvaller niet afhankelijk hoeft te zijn van één opvallende prompt. Die kan zijn aanpak tijdens een gesprek aanpassen en proberen misbruik te maken van de context die zich over meerdere beurten heeft opgebouwd. 25
Ook bij browsen en werkgerelateerde scenario’s zou Astra volgens OpenAI beter bestand zijn tegen promptinjecties en minder feitelijke fouten maken dan Sol. De vergelijking rond feitelijke fouten verdient wel nuance: de tests met eerder gemelde fouten gebruiken gesprekken die gebruikers al als onjuist hadden gemarkeerd. Zij meten dus niet rechtstreeks hoe vaak een model in dagelijks gebruik hallucineert. 25
30
De verbeteringen zijn relevant voor agents die onderzoek doen, programmeren, browsen of meerstapswerk uitvoeren. Volgens de release-opmerkingen van OpenAI kan Astra complexe taken afhandelen en documenten, spreadsheets en presentaties maken. 19
De beschikbare informatie is onvoldoende om te stellen dat Astra in alle omstandigheden veiliger is dan Anthropic Claude Opus 5 — of het nu gaat om feitelijke juistheid, directe jailbreaks of indirecte promptinjecties.
Voor een eerlijke vergelijking tussen modellen zijn dezelfde testset, identieke systeemprompts, vergelijkbare agenttools, een gedeelde definitie van een geslaagde aanval en evenveel ruimte voor een aanvaller om zich aan te passen nodig. Evaluaties van leveranciers en publieke red-teamtests kunnen op al die punten verschillen. Gray Swan vermeldt Claude Opus 5 als model in zijn Arena, maar de aangeleverde resultaten bevatten geen één-op-éénscorekaart van Astra tegenover Opus 5. 1
4
De best onderbouwde conclusie is daarom beperkter: OpenAI’s sterkste bewijs betreft Astra’s vooruitgang ten opzichte van zijn eigen voorganger, GPT-5.6 Sol.
Bij een directe jailbreak richt de aanvaller zich zichtbaar tot het model, bijvoorbeeld met een verzoek om regels te negeren of een verboden handeling uit te voeren. Astra’s gerapporteerde vooruitgang bij langere aanvalstrajecten is vooral relevant tegen dit type hardnekkige, adaptieve aanvaller. 25
Een indirecte promptinjectie komt mee met de inhoud die een agent verwerkt. Een kwaadwillende instructie kan zijn verstopt in een webpagina, e-mail, document, zoekresultaat, programmeerlog of tooluitvoer. Het doel is de agent weg te sturen van de taak die de gebruiker eigenlijk heeft gegeven. Gray Swans IPI-challenge richtte zich nadrukkelijk op zulke verborgen prompts in realistische omgevingen, waaronder webinhoud, tooluitvoer en sporen van code-agents. 5
Juist daardoor is het risico lastig te zien: de persoon die de agent gebruikt, krijgt de kwaadaardige instructie mogelijk nooit onder ogen.
Gray Swan rapporteerde voor zijn IPI Arena 13 frontiermodellen, 464 red-teamers, 41 scenario’s en meer dan 272.000 aanvalspogingen. De conclusie van het bedrijf: geen van de geteste modellen was immuun voor indirecte promptinjecties. 4
Dat is sterk bewijs dat indirecte promptinjectie voor AI-agents nog geen opgelost probleem is. Het is echter geen volledige, leveranciersneutrale ranglijst voor alle veiligheidsaspecten. De uitkomst betekent niet dat elk model even vaak faalt, en vervangt ook geen modelspecifieke evaluaties van feitelijkheid of weerstand tegen directe jailbreaks.
Bij een losse chatassistent kan een geslaagde injectie leiden tot een misleidend antwoord. Bij een bedrijfsagent die gekoppeld is aan systemen en gegevens kan de impact veel groter zijn.
OpenAI classificeert Astra binnen zijn Preparedness Framework als model met een Critical-niveau voor cybersecurity. Volgens OpenAI kan Astra, met de juiste tools en toegangsrechten, eerder onbekende beveiligingslekken vinden en manieren ontwikkelen om die uit te buiten in veel goed beveiligde systemen, zonder dat iemand elke stap begeleidt. 27
Dat kan waardevol zijn voor geautoriseerd defensief onderzoek. Maar het vergroot ook de gevolgen van een gecompromitteerde agentworkflow. Wie een agent via onbetrouwbare inhoud kan omleiden, kan mogelijk beïnvloeden wat die zoekt, welke tools hij gebruikt en welke handelingen hij voorstelt. Het risico neemt toe wanneer een agent toegang heeft tot gevoelige gegevens, code-repositories, cloudomgevingen, browsers of bedrijfsapplicaties.
Behandel weerstand tegen promptinjecties als één verdedigingslaag, niet als de beveiligingsgrens zelf. Voor agentworkflows met grote gevolgen doen organisaties er goed aan om:
OpenAI heeft sterkere isolatie, beperkte netwerk- en tooltoegang, monitoring en sandboxed uitvoering genoemd als waarborgen voor krachtigere systemen. 34
De gerapporteerde daling van feitelijke fouten en de betere weerstand tegen directe jailbreaks maken Astra volgens OpenAI een sterkere opvolger van GPT-5.6 Sol. 25
30 Maar de aangeleverde gegevens rechtvaardigen geen algemene uitspraak dat Astra in alle situaties veiliger is dan Claude Opus 5. Indirecte promptinjectie blijft bovendien een wezenlijke kwetsbaarheid voor het hele ecosysteem van AI-agents.
4
Voor organisaties is de praktische les helder: kies een zo sterk mogelijk model, maar ontwerp het systeem eromheen zo dat een kwaadaardig document of een webpagina de mogelijkheden en gekoppelde tools van de agent niet in een aanvalskanaal kan veranderen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI stelt dat GPT 6 Astra minder feitelijke fouten maakt en aanzienlijk beter bestand is tegen jailbreaks en promptinjecties dan GPT 5.6 Sol, ook bij langere aanvalstrajecten.
OpenAI stelt dat GPT 6 Astra minder feitelijke fouten maakt en aanzienlijk beter bestand is tegen jailbreaks en promptinjecties dan GPT 5.6 Sol, ook bij langere aanvalstrajecten. In Gray Swans IPI Arena bleek geen van de geteste modellen immuun voor verborgen promptinjecties; de test omvatte 13 frontiermodellen, 41 agentscenario's en meer dan 272.000 aanvalspogingen.
De beschikbare gegevens bieden geen rechtstreeks, vergelijkbaar bewijs voor een definitieve rangorde tussen Astra en Anthropic Claude Opus 5 op feitelijkheid of weerstand tegen jailbreaks.