Resultatene dekker åtte fagområder og består av bevis, moteksempler og forbedrede grenser . Blant de mest omtalte er:
Påstanden handler dermed ikke om at Astra har oppnådd høy score på en kjent test. OpenAI hevder at modellen har bidratt med resultater på problemer der forskere ikke hadde kommet videre med hovedspørsmålet på minst ti år .
OpenAI publiserte et manuskript på 249 sider sammen med Lean 4-sertifikater for hvert av de ti resultatene. Filene ligger på GitHub under Apache 2.0-lisensen .
Lean er et såkalt bevisassistent-system. Det kontrollerer de logiske stegene fra aksiomer og definisjoner til konklusjon, og kan avdekke blant annet manglende trinn, typefeil og inkonsistenser . Ifølge OpenAI står antallet «sorry»-markører – som brukes for å angi udokumenterte trinn – på null i de ti bevisene . Det betyr at de formaliserte bevisene kan kontrolleres av andre med en vanlig datamaskin.
Men maskinkontroll er ikke det samme som full faglig godkjenning. Lean kan bekrefte at en formell konklusjon følger av et bestemt sett med definisjoner og aksiomer. Systemet kan ikke alene fastslå at definisjonene samsvarer med det matematikere egentlig mente med det åpne problemet, at pressemeldingen beskriver teoremet riktig, eller at resultatet faktisk er nytt og betydningsfullt .
Eksperter må derfor fortsatt undersøke problemformuleringen, definisjonene, reduksjonene mellom påstandene og overgangen fra den uformelle matematiske forklaringen til den formaliserte versjonen .
OpenAI sier at tokenene som ble brukt til å finne alle de ti løsningene, ville ha kostet omtrent 2 000 dollar til Sol API-priser . Det er imidlertid ikke det samme som at hele forskningsprosjektet kostet 2 000 dollar.
Tallet gjelder bare en API-ekvivalent pris for tokenene i de vellykkede løsningsforslagene. Det inkluderer ikke mislykkede forsøk, parallelle søk, intern datakraft eller arbeidet med å velge problemene, kontrollere resultatene og gjøre argumentene om til et 249-siders manuskript .
Det er nettopp forskjellen mellom «kostnaden for å finne de ti vellykkede svarene» og den samlede kostnaden for forskningen som gjør tallet vanskelig å sammenligne direkte med menneskelig forskning. Likevel er beløpet lavt sammenlignet med at et årlig stipend for en matematikkstudent på doktorgradsnivå ved et toppuniversitet kan overstige 50 000 dollar .
De formelle bevisene gjør Astra-resultatene mer etterprøvbare enn vanlige KI-demonstrasjoner, men de besvarer ikke alle spørsmål. Forskere må fortsatt avgjøre om det formelle teoremet faktisk uttrykker det opprinnelige problemet, om resultatet er genuint nytt, og hvor viktig det er for fagfeltet .
Kognitiv forsker Gary Marcus har argumentert for at «suksess i matematikk er et særtilfelle». Matematikk egner seg spesielt godt for KI-systemer fordi svarene ofte kan kontrolleres med symbolske verktøy, og fordi det er mulig å lage store mengder syntetiske treningsdata med kjent korrekthet . Det følger ikke automatisk at en modell som lykkes med matematikk, vil ha tilsvarende pålitelighet i biologi, samfunnsvitenskap eller andre åpne og mindre formaliserbare områder.
Når modellen er proprietær og ikke tilgjengelig for andre forskere, blir det vanskeligere å vite hvordan den kom fram til resultatet. Det finnes heller ingen omforent metode for å avgjøre om et KI-resultat i praksis gjenskaper tidligere, ikke-kreditert arbeid .
Kunngjøringen kom dessuten kort tid etter Leiden-erklæringen fra juni 2026, der matematikere kritiserte KI-selskaper for å bruke pressemeldinger i stedet for fagfellevurderte publikasjoner til å lansere vitenskapelige påstander . Astra er ikke offentlig lansert, OpenAI har ikke publisert et modellkort, og selskapet har ikke oppgitt hvor mange mislykkede forsøk som lå bak de ti vellykkede resultatene .
Skeptikere har også vist til tidligere KI-påstander innen matematikk, blant annet rundt Google DeepMinds AlphaGeometry, som senere ble gjenstand for nærmere gransking .
Hvis resultatene holder etter uavhengig gjennomgang, kan den umiddelbare virkningen bli langt billigere søk etter bevis, moteksempler og matematiske hypoteser. Små forskergrupper eller enkeltpersoner kan i større grad få tilgang til verktøy som tidligere krevde mange år med spesialisert arbeid .
Samtidig kan forskningen bli mer avhengig av private selskaper som kontrollerer de kraftigste modellene. Dersom banebrytende matematisk arbeid krever tilgang til proprietære API-er, flyttes en del av den akademiske infrastrukturen fra universiteter og offentlige institusjoner til kommersielle aktører .
Det reiser også spørsmål om kreditering. Hvem skal regnes som opphavsperson når modellen finner et spor, mennesker velger ut og bearbeider argumentet, og et annet system formaliserer beviset? OpenAI har tidligere sagt at kreditering bør gjenspeile menneskenes bidrag, men Astra-kunngjøringen gjør grensene vanskeligere å trekke .
Thomas Bloom, matematiker ved University of Manchester, kalte resultatene «store nyheter», men avviste samtidig at de betyr at KI erstatter matematikere. Han påpekte at systemet bygger på mer enn hundre år med matematisk teori og er utviklet av matematikere .
Den mest nøkterne konklusjonen er derfor ikke at KI allerede har «løst matematikken». Det er at OpenAI har lagt fram ti konkrete påstander med langt mer etterprøvingsmateriale enn en vanlig testscore eller produktpresentasjon. Lean-filene hever terskelen for hva som må dokumenteres – men den endelige dommen ligger fortsatt hos matematikerne.