OpenAI ha avviato il 3 settembre una distribuzione limitata di GPT 6 Astra, definendolo il suo modello più intelligente e allineato e il primo valutato «Critical» per le capacità di cybersecurity. L’azienda riporta il 98% in FrontierMath Tier 4, il 99,9% in ARC AGI 3 e il 100% in ExploitBench.
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce with the September 3 launch of GPT-6 Astra—including its claimed intelligence, alignment, record benchmark results,. Article summary: OpenAI presented GPT‑6 Astra as a major step toward highly autonomous AI: “the world’s most intelligent and aligned model,” with record scores across agentic, scientific, computer-use, and cyber evaluations. These are Op. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI ha presentato GPT-6 Astra il 3 settembre come un modello destinato a lavori complessi e articolati: programmazione, ricerca, uso del computer e flussi professionali. L’azienda lo descrive come il proprio modello più intelligente e più allineato, ma non lo ha reso subito disponibile a tutti: il lancio è iniziato con un gruppo ristretto di organizzazioni. 2
5
13
L’elemento più rilevante non sono soltanto i risultati dichiarati nei benchmark. OpenAI afferma infatti che Astra è il primo dei suoi modelli a raggiungere il livello Critical per capacità di cybersecurity nel proprio Preparedness Framework. È quindi opportuno leggere insieme le promesse sulle capacità e le cautele nella distribuzione. 10
12
Secondo OpenAI, Astra è allo stato dell’arte nell’uso del computer, nella navigazione web, nell’ingegneria del software, nella cybersecurity, nelle attività scientifiche e nel lavoro professionale. La documentazione per sviluppatori lo indica per ragionamento complesso, codice, ricerca, creazione di documenti e workflow che coinvolgono più passaggi e più strumenti. 1
3
13
L’azienda ha comunicato tre risultati di particolare rilievo:
Sono risultati delle valutazioni pubblicate da OpenAI, non misurazioni replicate in modo indipendente. Un punteggio elevato può indicare un progresso sui compiti esaminati, ma non dimostra da solo un’intelligenza generale, affidabilità di giudizio nel mondo reale o autonomia sicura in ogni contesto.
OpenAI dichiara che Astra è il suo primo modello al livello Critical di capacità cyber secondo il suo framework. Nella definizione dell’azienda, significa che il modello, se dispone degli strumenti e degli accessi adatti, può individuare falle di sicurezza non note e sviluppare nuovi metodi per sfruttarle su molti sistemi ben protetti, senza che una persona debba guidarne ogni singolo passaggio. 10
12
Questa è una dichiarazione di capacità con due limiti essenziali:
OpenAI afferma di avere introdotto protezioni più robuste contro azioni cyber dannose, compreso un monitoraggio aggiuntivo durante la distribuzione di Astra. 5
10 La scelta di un rilascio graduale, anziché di una disponibilità immediata e generalizzata, è coerente con il rischio aggiuntivo che la società identifica.
OpenAI definisce Astra il suo modello più allineato, sostenendo che rispetti meglio i confini del compito e comunichi in modo più trasparente. 2
13
Questa formula va però interpretata con cautela. In una presentazione di prodotto, «allineato» descrive prestazioni ottenute con specifici metodi di addestramento e valutazione; non garantisce che un agente capisca sempre correttamente l’intento dell’utente, rimanga entro ogni vincolo operativo o possa essere usato senza supervisione umana. Le note di rilascio di OpenAI dicono che Astra integra un monitoraggio aggiuntivo per rilevare i casi in cui gli agenti possano avere interpretato male le istruzioni. 5
Per le organizzazioni che valutano l’uso di agenti, la domanda pratica non è quindi se il modello sia etichettato come allineato, ma quali autorizzazioni riceva, quali azioni richiedano una conferma, come vengano registrate le attività e con quale rapidità sia possibile fermarlo in caso di comportamento inatteso.
Il materiale disponibile attribuisce successive precisazioni ad alcuni risultati di valutazione, comprese questioni di possibile contaminazione dei benchmark e differenze tra configurazioni con accessi speciali e accesso standard in produzione. Descrive inoltre test nei quali il monitoraggio della sola catena di ragionamento era meno efficace del monitoraggio che includeva un contesto più completo.
Tuttavia, gli estratti delle fonti primarie fornite non contengono una cronologia completa e verificabile in modo indipendente di tutte le revisioni dei risultati, né l’intera metodologia di monitoraggio. La conclusione più prudente è che i punteggi più visibili e le valutazioni di sicurezza vadano trattati come evidenze di rilascio suscettibili di aggiornamenti. Prima di basarsi su un risultato o su una dichiarazione di distribuzione, conviene consultare la documentazione e i materiali di sicurezza più recenti. 2
3
10
Il lancio è arrivato dopo un precedente incidente durante test di sicurezza che coinvolgevano modelli OpenAI e che, secondo l’azienda, ha contribuito a definire l’approccio di sicurezza per Astra. I materiali di rilascio precisano che Astra non era il modello coinvolto e che gli insegnamenti dell’episodio sono stati integrati nelle misure di protezione. 10
Il contesto è importante perché i sistemi autonomi uniscono capacità del modello e possibilità di agire tramite browser, strumenti per il codice e altri software. La stessa facoltà di intervenire attraverso sistemi diversi che li rende utili rende più necessari contenimento, accessi minimi indispensabili e monitoraggio.
OpenAI ha dichiarato che Astra viene inizialmente distribuito a un insieme limitato di organizzazioni, con una disponibilità più ampia prevista in seguito. 5
13
Per gli sviluppatori, il listino API indica 10 dollari per milione di token in input e 50 dollari per milione di token in output. La pagina del modello riporta inoltre una finestra di contesto di 1,05 milioni di token e fino a 128.000 token in output. 3
L’accesso tramite ChatGPT segue un percorso separato e graduale. La documentazione di assistenza indica che GPT-6 Pro, basato su Astra, è in distribuzione per i piani Pro da 100 e 200 dollari, Business ed Enterprise; i piani Plus ricevono Astra in ChatGPT Work e Codex con l’avanzare del rollout. La disponibilità può variare tra prodotti ChatGPT e impostazioni dell’area di lavoro. 6
Il lancio di GPT-6 Astra unisce due messaggi inseparabili: OpenAI rivendica un importante salto in avanti nel lavoro complesso e agentico e, allo stesso tempo, classifica la capacità cyber del modello al più alto livello di rischio dichiarato. 10
13
I benchmark sono evidenza di ciò che OpenAI afferma che Astra possa fare nelle proprie valutazioni. L’accesso scaglionato, il monitoraggio aggiuntivo e le restrizioni cyber mostrano invece che l’azienda non considera tali capacità ordinarie. Per i team che valutano il modello, la priorità dovrebbe essere una distribuzione controllata: strumenti con perimetro ristretto, approvazioni esplicite per azioni importanti, ambienti isolati e registri verificabili. Non basta presumere che ottimi benchmark si traducano automaticamente in autonomia affidabile.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI ha avviato il 3 settembre una distribuzione limitata di GPT 6 Astra, definendolo il suo modello più intelligente e allineato e il primo valutato «Critical» per le capacità di cybersecurity.
OpenAI ha avviato il 3 settembre una distribuzione limitata di GPT 6 Astra, definendolo il suo modello più intelligente e allineato e il primo valutato «Critical» per le capacità di cybersecurity. L’azienda riporta il 98% in FrontierMath Tier 4, il 99,9% in ARC AGI 3 e il 100% in ExploitBench.
L’accesso è partito da un numero limitato di organizzazioni. L’API costa 10 dollari per milione di token in input e 50 dollari per milione in output; su ChatGPT la disponibilità dipende dal piano e procede gradualmente.