Secondo OpenAI, GPT 6 Astra commette meno errori fattuali ed è significativamente più resistente di GPT 5.6 Sol a jailbreak e prompt injection, anche lungo traiettorie d’attacco più estese. Nell’IPI Arena di Gray Swan, nessuno dei 13 modelli frontier testati è risultato immune alle prompt injection nascoste: 464 red...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI presenta GPT-6 Astra come un passo avanti rilevante rispetto a GPT-5.6 Sol: nelle proprie valutazioni, l’azienda afferma che Astra produce meno errori fattuali, resiste meglio alle prompt injection ed è significativamente più robusto ai jailbreak, compresi quelli sviluppati lungo interazioni più lunghe. 25
30
Il limite decisivo è però il contesto di impiego. Un comportamento migliore del modello non rende un agente AI immune da istruzioni ostili nascoste in pagine web, documenti, email, repository o risultati degli strumenti che utilizza. Nei test sulle indirect prompt injection (IPI), Gray Swan ha concluso che nessuno dei modelli esaminati era immune. 4
OpenAI sostiene che Astra sia significativamente più robusto ai jailbreak di GPT-5.6 Sol, anche quando l’attacco si sviluppa su traiettorie più lunghe. È un aspetto importante: un aggressore sofisticato non deve necessariamente fare affidamento su un singolo prompt palesemente malevolo, ma può adattare il proprio approccio nel corso di una conversazione multi-turno e sfruttare il contesto che si accumula. 25
L’azienda riferisce inoltre una maggiore robustezza alle prompt injection negli scenari di navigazione web e di lavoro, oltre a un numero inferiore di errori fattuali rispetto a Sol. Il confronto sull’accuratezza va comunque letto con cautela: i test di riproduzione degli errori analizzano conversazioni che gli utenti avevano già segnalato come errate; non rappresentano quindi un tasso di allucinazione tipico dell’uso quotidiano. 25
30
Sono miglioramenti rilevanti soprattutto per gli agenti chiamati a fare ricerche, programmare, navigare e portare a termine attività composte da più passaggi. Le note di rilascio di OpenAI descrivono Astra come adatto a compiti complessi e multi-step, inclusa la creazione di documenti, fogli di calcolo e presentazioni. 19
Le fonti disponibili non permettono di affermare in modo universale che Astra sia più sicuro di Claude Opus 5 di Anthropic per accuratezza fattuale, jailbreak diretti o prompt injection indirette.
Per una classifica credibile tra modelli servirebbero un set di test comune, strumenti agentici equivalenti, identiche istruzioni di sistema, una stessa definizione di successo dell’attacco e aggressori in grado di adattarsi in condizioni comparabili. Le valutazioni dei fornitori e le sfide pubbliche di red teaming possono invece differire su tutti questi aspetti. I materiali di Gray Swan indicano Claude Opus 5 tra i modelli presenti nella sua Arena, ma i risultati forniti non includono un confronto diretto e omogeneo tra Astra e Opus 5. 1
4
La conclusione sostenibile è più circoscritta: le evidenze più forti di OpenAI riguardano il miglioramento di Astra rispetto al suo predecessore, GPT-5.6 Sol.
Un jailbreak diretto parte dalla richiesta visibile dell’attaccante al modello, per esempio un tentativo di aggirarne le regole o di indurlo a compiere un’azione vietata. I miglioramenti dichiarati da Astra contro traiettorie d’attacco lunghe riguardano in particolare questo tipo di avversario persistente e adattivo. 25
Una prompt injection indiretta, invece, arriva attraverso un contenuto che l’agente sta consultando. L’istruzione ostile può essere nascosta in una pagina web, un’email, un documento, un risultato di ricerca, una traccia di programmazione o l’output di uno strumento, con l’obiettivo di deviare l’agente dal compito richiesto dall’utente. La sfida IPI di Gray Swan si è concentrata proprio su prompt nascosti in ambienti realistici, inclusi contenuti web, output di strumenti e tracce di agenti di coding. 5
La differenza è cruciale: chi usa l’agente potrebbe non vedere mai l’istruzione malevola.
Gray Swan ha comunicato i risultati di un’IPI Arena che ha coinvolto 13 modelli frontier, 464 red teamer, 41 scenari e oltre 272.000 tentativi d’attacco. La sua conclusione è che nessuno dei modelli testati sia risultato immune alle prompt injection indirette. 4
È un’indicazione forte del fatto che le IPI restano un problema irrisolto per gli agenti AI. Non è però una classifica completa e neutrale tra fornitori su tutte le dimensioni della sicurezza. Il risultato non dimostra che ogni modello fallisca con la stessa frequenza, né sostituisce le valutazioni specifiche su accuratezza fattuale o resistenza ai jailbreak diretti.
In un assistente conversazionale autonomo, una prompt injection riuscita può tradursi in una risposta fuorviante. In un agente aziendale collegato a sistemi operativi o gestionali, l’impatto potenziale può essere ben maggiore.
OpenAI classifica Astra alla soglia Critical per le capacità di cybersecurity nel suo Preparedness Framework. Secondo l’azienda, con strumenti e accessi appropriati Astra può individuare vulnerabilità di sicurezza precedentemente sconosciute e sviluppare modalità per sfruttarle in numerosi sistemi ben protetti, senza una guida umana passo per passo. 27
Queste capacità possono essere preziose nella difesa autorizzata. Ma alzano anche le conseguenze di un flusso agentico compromesso: chi riesce a deviare un agente attraverso contenuti non affidabili può tentare di influenzare cosa cerca, quali strumenti invoca o quali azioni propone. Il rischio cresce quando l’agente ha accesso a dati sensibili, repository di codice, ambienti cloud, browser o applicazioni aziendali.
La resistenza alle prompt injection va trattata come uno strato difensivo, non come il confine di sicurezza. Nei flussi agentici ad alto impatto, le organizzazioni dovrebbero:
OpenAI ha indicato isolamento più rigoroso, restrizioni su rete e strumenti, monitoraggio ed esecuzione in sandbox tra le misure di protezione per sistemi più capaci. 34
La riduzione degli errori fattuali segnalata e la maggiore resistenza ai jailbreak diretti rendono Astra un successore più solido di GPT-5.6 Sol. 25
30 Tuttavia, le fonti fornite non giustificano l’affermazione che sia categoricamente più sicuro di Claude Opus 5 in ogni contesto; inoltre, le prompt injection indirette restano una debolezza concreta dell’ecosistema degli agenti AI.
4
Per le imprese, la lezione pratica è semplice: scegliere il modello più robusto disponibile non basta. Occorre progettare il sistema circostante in modo che un documento o una pagina web malevola non possa trasformare capacità e strumenti connessi del modello in un canale controllato da un aggressore.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Secondo OpenAI, GPT 6 Astra commette meno errori fattuali ed è significativamente più resistente di GPT 5.6 Sol a jailbreak e prompt injection, anche lungo traiettorie d’attacco più estese.
Secondo OpenAI, GPT 6 Astra commette meno errori fattuali ed è significativamente più resistente di GPT 5.6 Sol a jailbreak e prompt injection, anche lungo traiettorie d’attacco più estese. Nell’IPI Arena di Gray Swan, nessuno dei 13 modelli frontier testati è risultato immune alle prompt injection nascoste: 464 red teamer hanno effettuato oltre 272.000 tentativi in 41 scenari.
Nei materiali disponibili non ci sono dati pubblici comparabili che consentano di stabilire una classifica definitiva tra Astra e Claude Opus 5 su accuratezza, jailbreak o prompt injection indirette.