Dat klinkt als een doorbraak met een ongekend laag prijskaartje. Tegelijkertijd wijzen wiskundigen en AI-onderzoekers erop dat de aankondiging verschillende belangrijke vragen openlaat.
Volgens het rapport van OpenAI beslaan de resultaten acht vakgebieden. Het gaat om bewijzen, tegenvoorbeelden en verbeterde bovengrenzen . De opvallendste voorbeelden zijn:
De claim gaat dus verder dan het oplossen van bekende wedstrijdopgaven. Het zou gaan om nieuwe resultaten bij vragen waarop de wiskundige gemeenschap lange tijd geen wezenlijke vooruitgang boekte.
OpenAI baseerde zich niet alleen op de tekst die Astra genereerde. Elk resultaat kreeg een formeel bewijs in Lean 4. Lean is een proof assistant: software die controleert of iedere logische stap binnen een vastgelegde verzameling definities en axioma’s geldig is .
De bestanden zijn openbaar gemaakt op GitHub. Volgens de gepubliceerde repository staat de teller voor sorry — een aanduiding voor nog niet bewezen stappen — op nul bij alle tien bewijzen . Daardoor kunnen andere onderzoekers de formele bestanden zelfstandig controleren op een computer.
Dat maakt de resultaten beter toetsbaar dan veel eerdere AI-demonstraties, maar het lost niet elke vraag op. Lean kan bevestigen dat een formele conclusie volgt uit de formele definities. Het systeem kan niet zelf vaststellen of:
Daarom zullen experts nog steeds de formulering, definities, afleidingen, nieuwheid en vertaling van het informele argument naar de formele versie moeten controleren . Een bewijs dat formeel klopt, is dus niet automatisch hetzelfde als een volledig beoordeeld en betekenisvol onderzoeksresultaat.
OpenAI zegt dat de tokens die nodig waren om de tien succesvolle oplossingen te genereren, tegen de tarieven van de Sol-API ongeveer 2.000 dollar zouden hebben gekost . Dat is ongeveer 200 dollar per resultaat.
Het bedrag moet wel nauwkeurig worden geïnterpreteerd. Het gaat om een API-equivalent voor de tokens van de succesvolle oplossingen, niet om de totale kosten van het onderzoeksproject. Mislukte pogingen, parallelle zoekruns en de interne rekenkracht die nodig was om tot een bruikbaar bewijs te komen, zijn niet in dit cijfer opgenomen . Ook de training van het model, de infrastructuur, het werk van menselijke onderzoekers en het opstellen en formaliseren van het manuscript vallen er niet onder.
Juist die nuance is belangrijk. De cijfers suggereren dat AI in de toekomst goedkoop kan worden ingezet voor bewijszoekwerk, maar ze zeggen nog niet hoeveel rekenkracht en menselijk werk nodig zijn om een betrouwbare onderzoeksuitkomst te selecteren en te controleren.
De reactie uit de wiskundige gemeenschap is verdeeld. Sommige onderzoekers zien de Lean-bestanden als een belangrijke stap richting controleerbare AI-wiskunde. Anderen waarschuwen dat formele correctheid niet automatisch betekent dat een resultaat verrassend, relevant of correct gepresenteerd is als oplossing van het bedoelde probleem .
Cognitief wetenschapper Gary Marcus stelde dat succes in wiskunde een bijzonder geval is. Wiskundige beweringen lenen zich relatief goed voor formele controle en voor het genereren van synthetische oefendata waarvan de juistheid kan worden nagegaan. Dat betekent volgens hem niet dat dezelfde prestaties zonder meer door te trekken zijn naar wetenschap in het algemeen .
Ook blijft de vraag bestaan hoe AI-gegenereerde wiskunde moet worden geaudit wanneer het model zelf een gesloten, commercieel systeem is. Onderzoekers moeten niet alleen het eindbewijs controleren, maar ook nagaan of het resultaat geen ongecrediteerde reconstructie van bestaand werk is .
Verder kwam de aankondiging zonder publieke release van Astra, modelkaart, reproduceerbare benchmarks of informatie over het aantal mislukte pogingen achter de tien successen . Critici plaatsen de presentatie daarom in een bredere discussie over AI-bedrijven die onderzoeksresultaten via persberichten bekendmaken in plaats van via traditionele peerreview. Die discussie kreeg eerder in 2026 extra aandacht door de zogenoemde ‘Leiden Declaration’ .
Vergelijkingen met eerdere AI-claims in de wiskunde, waaronder AlphaGeometry van Google DeepMind, hebben eveneens tot voorzichtigheid geleid. Ook eerdere doorbraken werden later verder onderzocht en genuanceerd .
Als de resultaten standhouden, kunnen de gevolgen aanzienlijk zijn — maar waarschijnlijk niet in de vorm van het verdwijnen van wiskundigen.
Thomas Bloom, wiskundige aan de University of Manchester en beheerder van erdosproblems.com, noemde de resultaten “groot nieuws”. Tegelijkertijd wees hij het idee af dat AI hiermee wiskundigen vervangt: het model bouwt voort op meer dan een eeuw wiskundige theorie en is zelf door wiskundigen ontwikkeld .
De voorzichtige conclusie is daarom tweeledig. OpenAI heeft met de tien manuscripten en de Lean-certificaten meer controleerbaar materiaal gepubliceerd dan bij een gewone AI-benchmark. Maar of Astra daadwerkelijk tien belangrijke open problemen heeft opgelost — in de betekenis die wiskundigen daaraan geven — moet nog blijken uit onafhankelijke controle en peerreview.