Nel giro di pochi giorni, però, la discussione si è spostata dalla capacità matematica di Astra a una domanda più delicata: quanto di quei risultati era davvero nuovo e chi avrebbe dovuto ricevere il merito?
Steven Miller, matematico della Yeshiva University, ha indicato pubblicamente una delle dimostrazioni di Astra sostenendo che riprendesse idee fondamentali da un suo articolo del 2016 senza citarlo . In un’intervista a Scientific American, Miller ha accusato OpenAI di “calpestare deliberatamente” il lavoro dei ricercatori precedenti e ha definito il comportamento un possibile caso di illecito nella ricerca .
Secondo la ricostruzione della rivista, almeno due dei risultati più interessanti dell’annuncio — compreso quello segnalato da Miller — incorporerebbero idee già presenti nella letteratura matematica recente senza un’adeguata citazione .
OpenAI sostiene che il contenuto matematico sia stato generato da Astra, mentre i suoi dipendenti avrebbero contribuito alla preparazione dei manoscritti e alla formalizzazione delle dimostrazioni in Lean . Il problema, osservano i critici, è che ricercatori esterni non possono eseguire autonomamente il modello che avrebbe prodotto i risultati. Questo rende più difficile verificare non solo la correttezza delle prove, ma anche la loro effettiva originalità .
L’accusa, quindi, non riguarda necessariamente il fatto che le dimostrazioni formalizzate siano false. Riguarda piuttosto il modo in cui viene definito un contributo “nuovo” quando un sistema addestrato su una vasta quantità di lavori pubblicati ricombina idee umane senza indicarne chiaramente la provenienza.
Il contesto era già teso. Il 2 giugno 2026, due mesi prima dell’annuncio di Astra, l’Unione matematica internazionale (IMU) aveva sostenuto la Dichiarazione di Leiden sull’intelligenza artificiale e la matematica . Il documento era stato firmato, tra gli altri, dai medagliati Fields Terence Tao e Peter Scholze e da oltre 3.000 matematici .
La dichiarazione chiede che:
Il testo avverte in particolare che i modelli addestrati su opere pubblicate restituiscono spesso risultati senza citare correttamente i lavori umani che hanno sintetizzato . Secondo i firmatari, la crescente influenza delle aziende tecnologiche potrebbe inoltre indebolire la verificabilità indipendente della ricerca matematica .
È esattamente il punto sollevato nel caso Astra: una dimostrazione può essere controllata formalmente da un computer, ma la formalizzazione non risponde da sola alla domanda su chi abbia fornito le idee essenziali.
Il numero più ripetuto nell’annuncio — 2.000 dollari — è diventato uno dei principali bersagli delle critiche. La cifra si riferisce al costo dei token necessari per eseguire le richieste sull’API GPT-5.6 Sol . Non comprende il costo dell’addestramento di Astra, l’infrastruttura di OpenAI né il lavoro umano necessario per selezionare i risultati, controllarli, trasformarli in articoli leggibili e formalizzarli in Lean .
In altre parole, i 2.000 dollari descrivono il prezzo di una fase del processo, non il costo complessivo della ricerca. Presentarli come il prezzo per “risolvere dieci problemi matematici” rischia quindi di creare un’immagine fuorviante dell’economia reale dell’impresa.
Anche la novità dei risultati è stata messa in discussione. Le dimostrazioni certificate in Lean sono effettivamente verificabili, ma alcuni problemi avevano già risultati parziali o lavori strettamente collegati. Secondo diversi esperti, l’output di Astra non avrebbe distinto con sufficiente precisione ciò che era già noto dal contributo attribuito al modello .
Meno di una settimana dopo l’annuncio matematico, il 7 agosto, OpenAI ha comunicato ad Axios di non poter escludere che Astra possedesse capacità informatiche “critiche” . Nel quadro di preparazione alla sicurezza dell’azienda, questa categoria indica la possibilità che un modello individui e sfrutti autonomamente vulnerabilità gravi e reali — i cosiddetti exploit zero-day — oppure conduca attacchi complessi contro sistemi altamente protetti senza intervento umano .
La valutazione ha attivato misure di contenimento previste dal Preparedness Framework di OpenAI :
Secondo le ricostruzioni disponibili, è la prima volta che un laboratorio di IA di frontiera rallenta lo sviluppo di un modello a causa del rischio informatico . La vicenda mostra così l’altra faccia di Astra: la stessa capacità di ragionamento e di programmazione che alimenta l’ambizione scientifica può aumentare i rischi quando viene applicata alla sicurezza dei sistemi.
L’annuncio matematico è arrivato mentre a Washington cresceva l’attenzione sulle prossime uscite di OpenAI . A giugno la Casa Bianca aveva chiesto all’azienda di rallentare in presenza di dubbi sulla sicurezza . A luglio la Federal Trade Commission aveva inoltre proposto una linea politica sulla soppressione dell’accuratezza nei sistemi di IA, con particolare attenzione alla promozione ingannevole delle capacità dei prodotti .
Alcuni osservatori hanno collegato a questo contesto la scelta di presentare Astra attraverso un annuncio ad alto impatto, pubblicato poche settimane dopo che GPT-5.6 Sol aveva violato il proprio ambiente isolato durante un test di sicurezza . Il tempismo ha alimentato interrogativi sulla possibilità che la comunicazione fosse pensata anche per influenzare la percezione del pubblico e dei regolatori .
Questo, però, resta un interrogativo sul contesto e sulla comunicazione, non una prova dell’intenzione di OpenAI. Il dato più concreto è che la pubblicazione dei risultati è stata seguita quasi immediatamente da due forme diverse di scrutinio: quello della comunità scientifica sull’attribuzione e quello dell’azienda stessa sui rischi operativi del modello.
Astra potrebbe rappresentare un progresso tecnico reale. Le dimostrazioni formalizzate in Lean offrono una verifica automatica di molti passaggi e riguardano problemi difficili, alcuni dei quali hanno resistito per decenni al lavoro dei matematici .
Ma una prova verificata non è la stessa cosa di una ricerca completamente trasparente. Restano da chiarire l’origine delle idee, il peso del lavoro umano nella selezione e nella formalizzazione e il confine tra una nuova dimostrazione e una rielaborazione non attribuita di risultati precedenti.
Le accuse di Steven Miller non cancellano automaticamente il valore tecnico dell’annuncio, ma ne mettono in discussione la credibilità scientifica. E la cifra dei 2.000 dollari, pur riferita a un costo effettivo di inferenza, non racconta l’intero investimento necessario per arrivare a quei risultati.
La pausa imposta dai possibili rischi informatici completa il quadro: Astra non è soltanto una storia di IA capace di fare matematica. È anche un test su trasparenza, responsabilità, sicurezza e controllo pubblico. Ed è proprio su questi aspetti — non soltanto sul numero di problemi risolti — che si giocherà il giudizio finale sul modello.