De resultaten bestrijken een opvallend breed terrein: hogedimensionale meetkunde, coderingstheorie, rekenkundige circuitcomplexiteit, groepentheorie, operatoralgebra’s, kwantumcomplexiteit, roostercryptografie en extremale combinatoriek .
Astra zelf is niet vrijgegeven. OpenAI publiceerde in plaats daarvan Lean 4-certificaten op GitHub onder een Apache 2.0-licentie. In de repository staat volgens de berichtgeving een sorry-telling van nul. In Lean betekent sorry doorgaans dat een ontbrekende bewijsstap tijdelijk wordt geaccepteerd; nul meldingen zou er dus op wijzen dat alle formele stappen van de tien bewijzen daadwerkelijk zijn gecontroleerd .
Dat maakt deze aankondiging anders dan een gewone demonstratie van een chatbot. De vraag is niet alleen of een menselijke expert het antwoord overtuigend vindt: de formele bewijsassistent controleert of de uitgeschreven redenering binnen het gekozen wiskundige systeem klopt. Dat zegt echter niet automatisch dat iedere claim over de manier waarop Astra het resultaat vond, onafhankelijk is gereproduceerd.
Onderzoekers zoals Noam Brown noemden de aankondiging een belangrijke stap voor wetenschappelijk redeneren . Tegelijkertijd kwamen er meerdere kanttekeningen.
Geen Millenniumproblemen. Geen van de tien kwesties is een van de zeven Clay Millenniumproblemen, zoals P versus NP of de Riemann-hypothese . Dat maakt de resultaten niet onbelangrijk: de vraag naar het bestaan van niet-sofische groepen geldt bijvoorbeeld als een serieuze open vraag sinds Mikhail Gromov het begrip soficiteit in 1999 introduceerde . Wel ligt de nieuwswaarde voor een breed publiek anders dan wanneer Astra bijvoorbeeld een Millenniumprobleem zou oplossen.
Nog geen peerreview. OpenAI bracht de resultaten rechtstreeks naar buiten, zonder voorafgaande publicatie in een door vakgenoten beoordeeld wiskundetijdschrift of in congresverslagen . Daardoor moeten experts nog beoordelen of de argumenten nieuw, correct en inhoudelijk zo sterk zijn als de aankondiging suggereert. Ook blijft de grens tussen AI-gegenereerde ontdekking en menselijke interpretatie of redactie lastig scherp te trekken. OpenAI verwees zelf naar de Leiden Declaration on AI and Mathematics, die juist dit soort vragen over AI en wetenschappelijk auteurschap adresseert .
Twijfel over bredere toepasbaarheid. Cognitief wetenschapper Gary Marcus noemt succes met formele wiskunde een mogelijk “speciaal geval”. Wiskundige beweringen kunnen vaak goedkoop worden gecontroleerd met symbolische hulpmiddelen, terwijl er ook grote hoeveelheden synthetische oefendata met gegarandeerd correcte antwoorden kunnen worden gemaakt . Dat geldt niet op dezelfde manier voor de meeste andere wetenschappelijke disciplines. Goed presteren in één domein bewijst daarom niet dat een model ook breed wetenschappelijk kan redeneren.
Beperkte reproduceerbaarheid. Omdat Astra niet beschikbaar is en de precieze promptmethode niet volledig openbaar is gemaakt, kunnen onafhankelijke onderzoekers het generatieproces niet één op één herhalen . De Lean-bestanden maken de formele bewijzen inspecteerbaar, maar geven buitenstaanders geen toegang tot het model, de gebruikte instellingen of de volledige werkwijze waarmee de oplossingen zijn gevonden.
Timing en marketing. De aankondiging viel samen met OpenAI’s positionering van Astra als volgende grote modelreeks. Dat roept de vraag op of het moment mede voor marketingimpact is gekozen, in plaats van uitsluitend voor een zo streng mogelijke wetenschappelijke presentatie .
Als de argumenten de beoordeling door wiskundigen doorstaan, zouden meerdere resultaten vragen afsluiten die al tientallen jaren openstaan. Het meest in het oog springende voorbeeld is de eerste expliciete constructie van een niet-sofische groep: daarmee zou een vraag van meer dan 25 jaar oud worden beslecht . Zelfs sceptici erkennen dat OpenAI veel meer controleerbaar materiaal heeft gepubliceerd dan gebruikelijk is bij een bedrijfsdemonstratie .
De belangrijkste conclusie is voorlopig dus niet dat Astra “de wiskunde heeft opgelost”. De interessantere vraag is of een model dat formele, controleerbare problemen binnen een relatief afgebakend domein aankan, ook betrouwbaar nieuwe inzichten kan leveren in bredere wetenschap. Daarvoor is het bewijs nog niet geleverd.