Selon OpenAI, GPT 6 Astra commet moins d’erreurs factuelles et résiste nettement mieux aux jailbreaks ainsi qu’aux injections de prompts que GPT 5.6 Sol, y compris lors d’attaques adaptatives sur plusieurs étapes. L’IPI Arena de Gray Swan a réuni 13 modèles de pointe, 464 red teamers, 41 scénarios et plus de 272 000...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI présente GPT-6 Astra comme une avancée nette par rapport à GPT-5.6 Sol en matière de sûreté : le modèle produirait moins d’erreurs factuelles, résisterait davantage aux injections de prompts et serait significativement plus robuste aux jailbreaks, y compris quand l’attaque se déploie sur une longue séquence d’échanges. 25
30
Mais une meilleure robustesse du modèle ne rend pas un agent IA invulnérable aux instructions hostiles dissimulées dans les pages web, documents, e-mails, dépôts de code ou résultats d’outils qu’il consulte. Dans son test consacré aux injections indirectes de prompts, Gray Swan indique qu’aucun des modèles évalués n’était immunisé. 4
OpenAI affirme qu’Astra est significativement plus robuste aux jailbreaks que GPT-5.6 Sol, y compris sur des trajectoires plus longues. C’est important : un attaquant ne se limite pas forcément à une consigne manifestement malveillante dans un unique message. Il peut adapter sa stratégie au fil d’une conversation et tenter d’exploiter le contexte accumulé. 25
OpenAI rapporte aussi une meilleure résistance aux injections de prompts dans des situations de navigation web et de travail, ainsi qu’une baisse des erreurs factuelles par rapport à Sol. Cette dernière mesure doit toutefois être lue avec prudence : les tests de reproduction d’erreurs portent sur des conversations ChatGPT déjà signalées par les utilisateurs comme erronées. Ils ne mesurent donc pas un taux d’hallucination représentatif de tous les usages quotidiens. 25
30
Ces progrès sont particulièrement pertinents pour des agents chargés de rechercher des informations, programmer, naviguer sur le web ou accomplir des tâches complexes en plusieurs étapes. Les notes de version d’OpenAI indiquent qu’Astra peut notamment produire des documents, feuilles de calcul et présentations en suivant des modèles et des consignes. 19
Les sources disponibles ne permettent pas d’affirmer qu’Astra est universellement plus sûr que Claude Opus 5 d’Anthropic, que ce soit pour la factualité, les jailbreaks directs ou les injections indirectes.
Pour comparer équitablement deux modèles, il faudrait un même jeu de tests, des outils agentiques comparables, les mêmes instructions système, une définition partagée de la réussite d’une attaque et des attaquants pouvant s’adapter dans des conditions identiques. Les évaluations des éditeurs et les exercices publics de red teaming peuvent diverger sur chacun de ces paramètres. Gray Swan cite Claude Opus 5 parmi les modèles présents dans son Arena, mais les résultats fournis ne constituent pas une fiche de score comparable, modèle contre modèle, entre Astra et Opus 5. 1
4
La conclusion étayée est donc plus limitée : les preuves les plus solides concernent l’amélioration d’Astra par rapport au prédécesseur d’OpenAI, GPT-5.6 Sol.
Un jailbreak direct commence par une demande visible adressée au modèle : par exemple, une tentative de contourner ses règles ou de lui faire accomplir une action interdite. Les gains rapportés par OpenAI face à des attaques longues sont surtout pertinents contre cet adversaire persistant et adaptatif. 25
Une injection indirecte de prompt arrive, elle, via un contenu lu par l’agent. Une instruction hostile peut être cachée dans une page web, un e-mail, un document, un résultat de recherche, une trace d’agent de code ou la sortie d’un outil. Son objectif est de détourner l’agent de l’intention de son utilisateur. Le défi IPI de Gray Swan visait précisément des prompts dissimulés dans des environnements réalistes, dont le web, les sorties d’outils et les traces d’agents de programmation. 5
Le point décisif est que la personne utilisant l’agent peut ne jamais voir l’instruction malveillante.
Gray Swan rapporte que son IPI Arena a impliqué 13 modèles de pointe, 464 red teamers, 41 scénarios et plus de 272 000 tentatives d’attaque. Sa conclusion : aucun modèle testé n’est sorti indemne des injections indirectes de prompts. 4
C’est un signal fort : l’injection indirecte reste un problème non résolu pour les déploiements d’agents. Cela ne constitue pas pour autant un classement neutre et complet de tous les aspects de la sûreté. Ces résultats ne prouvent ni que tous les modèles échouent au même rythme, ni qu’ils remplacent les évaluations spécifiques de la factualité ou de la résistance aux jailbreaks directs.
Avec un assistant conversationnel isolé, une injection réussie peut se traduire par une réponse trompeuse. Avec un agent connecté à des systèmes métier, les conséquences potentielles sont bien plus importantes.
OpenAI classe Astra au niveau Critical pour les capacités de cybersécurité dans son Preparedness Framework. Selon l’entreprise, avec les outils et les accès appropriés, Astra peut découvrir des failles jusqu’alors inconnues et élaborer des moyens de les exploiter dans de nombreux systèmes fortement protégés, sans guidage humain à chaque étape. 27
Cette capacité peut servir à la défense autorisée. Mais elle augmente aussi l’enjeu d’un flux agentique compromis : un attaquant qui détourne l’agent au moyen d’un contenu non fiable peut chercher à influencer ses recherches, les outils qu’il appelle ou les actions qu’il propose. Le risque augmente lorsque l’agent a accès à des données sensibles, des dépôts de code, des environnements cloud, un navigateur ou des applications métiers.
La résistance aux injections de prompts doit être considérée comme une couche de défense, et non comme une frontière de sécurité. Pour les flux agentiques à fort impact, les organisations devraient notamment :
OpenAI a notamment évoqué l’isolement renforcé, la restriction des accès réseau et aux outils, la supervision et l’exécution en environnement isolé comme garde-fous pour les systèmes plus capables. 34
Les réductions d’erreurs factuelles rapportées et la meilleure résistance aux jailbreaks font d’Astra un successeur plus robuste à GPT-5.6 Sol. 25
30 En revanche, les éléments disponibles ne justifient pas de le déclarer catégoriquement plus sûr que Claude Opus 5 dans tous les contextes, et l’injection indirecte de prompts reste une faiblesse importante de l’écosystème des agents.
4
Pour les entreprises, la règle pratique est simple : retenir le modèle le plus robuste disponible, mais concevoir le système qui l’entoure de sorte qu’un document ou une page web malveillante ne puisse pas transformer ses capacités et ses outils connectés en canal de contrôle pour un attaquant.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Selon OpenAI, GPT 6 Astra commet moins d’erreurs factuelles et résiste nettement mieux aux jailbreaks ainsi qu’aux injections de prompts que GPT 5.6 Sol, y compris lors d’attaques adaptatives sur plusieurs étapes.
Selon OpenAI, GPT 6 Astra commet moins d’erreurs factuelles et résiste nettement mieux aux jailbreaks ainsi qu’aux injections de prompts que GPT 5.6 Sol, y compris lors d’attaques adaptatives sur plusieurs étapes. L’IPI Arena de Gray Swan a réuni 13 modèles de pointe, 464 red teamers, 41 scénarios et plus de 272 000 tentatives d’attaque : aucun modèle testé n’a été jugé immunisé contre les injections indirectes.
Les éléments fournis ne permettent pas d’établir un classement fiable entre Astra et Claude Opus 5 pour la factualité, les jailbreaks directs ou les injections indirectes.