Binnen enkele dagen verschoof de aandacht echter van de technische prestatie naar de vraag of de resultaten wel op een eerlijke en transparante manier waren gepresenteerd. Onderzoekers wezen erop dat ten minste twee bewijzen voortbouwden op bestaande ideeën zonder die voldoende te citeren. Daarmee raakte de aankondiging aan een gevoelig punt in de academische wereld: een bewijs kan formeel correct zijn, maar dat betekent nog niet dat de historische herkomst van de ideeën goed is weergegeven.
De wiskundige Steven Miller van Yeshiva University wees publiekelijk een van de Astra-bewijzen aan als een resultaat dat belangrijke ideeën uit zijn artikel uit 2016 zou hergebruiken zonder bronvermelding . Tegen Scientific American zei Miller dat OpenAI volgens hem “running roughshod over the work of others who came before them in a deliberate way” — met andere woorden: dat het bedrijf bewust over het werk van voorgangers heen walst. Hij noemde het patroon wetenschappelijk wangedrag .
Volgens de berichtgeving van Scientific American bevatten twee van de meest opvallende resultaten uit de Astra-aankondiging bestaande ideeën uit recente wiskundige literatuur zonder adequate verwijzingen . OpenAI-medewerkers hielpen bij het voorbereiden van de manuscripten en bij het formaliseren van de bewijzen in Lean. Het bedrijf houdt echter vol dat de wiskundige inhoud door Astra is gegenereerd .
Een bijkomend probleem is de beperkte controleerbaarheid van die claim. Externe onderzoekers kunnen het model dat de oorspronkelijke resultaten produceerde niet zelfstandig draaien. Zij kunnen de uiteindelijke Lean-certificaten controleren, maar niet volledig nagaan hoe Astra tot de ideeën kwam of hoe origineel die denkstappen waren .
De kritiek kwam niet uit de lucht vallen. Op 2 juni 2026 onderschreef de International Mathematical Union (IMU) de Leidse Verklaring over kunstmatige intelligentie en wiskunde . De verklaring werd mede ondertekend door Fieldsmedaillewinnaars Terence Tao en Peter Scholze en door meer dan 3.000 wiskundigen .
De ondertekenaars waarschuwden onder meer voor een situatie waarin AI-systemen ideeën uit gepubliceerd onderzoek verwerken, maar de menselijke onderzoekers achter die ideeën niet correct vermelden . Ook vreesden zij dat technologiebedrijven steeds meer invloed krijgen op onderzoek dat moeilijk onafhankelijk te verifiëren is .
De verklaring vraagt in het bijzonder om:
Daarmee draait het debat niet alleen om de vraag of een bewijs klopt. Ook de vragen “Wie ontdekte het idee?”, “Welke eerdere resultaten waren noodzakelijk?” en “Wie draagt verantwoordelijkheid?” zijn essentieel binnen de wiskunde.
Het bedrag van 2.000 dollar werd het meest geciteerde onderdeel van de aankondiging — en tegelijk een van de meest bekritiseerde. Het gaat volgens OpenAI uitsluitend om de geschatte kosten van de tokens die nodig waren om de oplossingen te genereren bij de tarieven van GPT-5.6 Sol .
Daarmee worden belangrijke kosten buiten beeld gelaten: de training van Astra zelf, de menselijke arbeid voor het selecteren en redigeren van de resultaten en het omzetten van de argumenten in formele Lean-bewijzen. Ook de kosten van verificatie, onderzoek en publicatie zitten niet in dat bedrag .
De claim zegt dus niet dat tien wiskundige onderzoeksresultaten in hun geheel voor 2.000 dollar zijn geproduceerd. Ze beschrijft alleen een specifieke schatting van de inferentiekosten — de rekenkosten tijdens het gebruik van het model. Dat verschil is belangrijk, zeker wanneer het bedrag wordt gebruikt als bewijs dat AI-onderzoek bijna spotgoedkoop is geworden.
Ook daarover ontstond discussie. De Lean-bewijzen zijn volgens de beschikbare informatie echte, machinecontroleerbare formaliseringsresultaten. Maar verschillende deskundigen merkten op dat sommige problemen al gedeeltelijke resultaten of nauw verwant eerder werk kenden. Volgens hen maakte Astra onvoldoende duidelijk welk deel werkelijk nieuw was en welk deel aansloot op bestaande literatuur .
Formele verificatie beantwoordt daarmee vooral één vraag: volgt de conclusie logisch uit de vastgelegde aannames en stappen? Ze beantwoordt niet automatisch de vraag of alle onderliggende ideeën origineel zijn of dat eerdere onderzoekers correct erkenning hebben gekregen.
Minder dan een week na de wiskundeaankondiging volgde een veel ernstiger veiligheidskwestie. Op 7 augustus 2026 zei OpenAI tegen Axios dat het niet kon uitsluiten dat Astra over “kritieke” cybercapaciteiten beschikte . Binnen het Preparedness Framework van OpenAI betekent dat onder meer dat een model mogelijk zelfstandig ernstige softwarekwetsbaarheden — zogenoemde zero-days — kan opsporen en uitbuiten, of complexe cyberaanvallen tegen goed beveiligde doelen kan uitvoeren zonder menselijke tussenkomst .
OpenAI nam daarop verschillende maatregelen:
Volgens berichtgeving hierover was dit de eerste keer dat een frontier-AI-lab de ontwikkeling van een model afremde vanwege cyberrisico’s . De wiskundige doorbraak en de daaropvolgende veiligheidsingreep laten zo twee kanten van dezelfde ontwikkeling zien: een model dat indrukwekkend complexe taken uitvoert, kan ook capaciteiten ontwikkelen die moeilijker te beheersen zijn.
De timing speelde eveneens een rol. Washington hield de volgende releases van OpenAI al nauwlettend in de gaten . Het Witte Huis had het bedrijf in juni opgeroepen de ontwikkeling vanwege veiligheidszorgen af te remmen . Daarnaast publiceerde de Amerikaanse Federal Trade Commission (FTC) in juli 2026 een voorgestelde beleidsverklaring over het onderdrukken van nauwkeurigheid in AI-systemen, met bijzondere aandacht voor misleidende marketing van AI-capaciteiten .
Tegen die achtergrond vroegen sommige waarnemers zich af of de wiskundeaankondiging niet alleen bedoeld was om een technische prestatie te delen, maar ook om het publieke en politieke beeld van OpenAI’s volgende model te beïnvloeden . Dat is geen bewezen motief, maar het verklaart wel waarom de presentatie kritischer werd bekeken dan een gewone onderzoeksrelease.
Astra lijkt een reële technische prestatie te hebben geleverd: het systeem produceerde resultaten voor moeilijke problemen en leverde formeel controleerbare bewijzen. Tegelijkertijd ondermijnen de beschuldigingen van gebrekkige bronvermelding de geloofwaardigheid van de presentatie. Een machine kan aantonen dat een formeel vastgelegde redenering klopt, maar daarmee is nog niet vastgesteld wie de ideeën heeft ontwikkeld of hoeveel bestaand werk erin is verwerkt.
Ook het bedrag van 2.000 dollar moet voorzichtig worden geïnterpreteerd. Het is een schatting van tokenkosten, geen volledige rekening voor de ontwikkeling en publicatie van het onderzoek. En de cyberveiligheidszorgen die kort daarna tot een gedeeltelijke pauze leidden, maken duidelijk hoe smal de grens is tussen het demonstreren van nieuwe capaciteiten en het aantonen dat die capaciteiten verantwoord kunnen worden ontwikkeld.