Det er et potentielt gennembrud for AI-baseret forskning – men også en påstand, som matematikere og AI-forskere mener bør mødes med betydelig forsigtighed .
OpenAI beskriver resultaterne som en blanding af beviser, modeksempler og forbedrede grænser på tværs af otte forskningsområder . Blandt de mest markante er:
Det er værd at understrege, at resultaterne ikke alle har samme karakter. Nogle er fulde beviser, andre er modeksempler, mens andre igen består af forbedrede matematiske grænser .
OpenAI bad ikke offentligheden om blot at stole på modellens tekst. For hvert resultat blev der udarbejdet et formelt bevis i Lean 4 – en fil, som en computer kan kontrollere trin for trin .
Lean er en såkaldt proof assistant, altså et system til formel beviskontrol. Det undersøger, om en konklusion følger logisk fra de angivne aksiomer og definitioner, og kan blandt andet opdage manglende trin, typefejl og inkonsistente slutninger . OpenAI offentliggjorde Lean-filerne på GitHub, og repositoryets tæller for "sorry" – markører for ubesvarede eller ubeviste trin – står ifølge virksomheden på nul for alle ti beviser .
Det gør påstandene langt mere efterprøvelige end almindelige AI-demonstrationer, hvor man kun får en tekstlig forklaring eller et benchmarkresultat. Men formel verifikation har også en klar grænse.
Lean kan kontrollere, at et formelt udsagn følger af de formelle definitioner. Det kan ikke i sig selv afgøre, om definitionerne præcist svarer til det problem, som matematikere mente, de undersøgte. Det kan heller ikke afgøre, om en pressemeddelelse gengiver sætningen korrekt, om resultatet er nyt, eller hvor vigtigt og overraskende det er .
Derfor skal fagfolk stadig gennemgå problemformuleringer, definitioner, reduktioner, nyhedsværdi og forbindelsen mellem den uformelle matematiske idé og den formelle Lean-version .
Det mest opsigtsvækkende tal i annonceringen er måske ikke antallet af resultater, men prisen. OpenAI oplyser, at tokenmængden, der blev brugt til at finde de ti løsninger, ville svare til cirka 2.000 dollar ved Sol API-priser .
Det er dog ikke det samme som, at hele forskningsprojektet kostede 2.000 dollar. Tallet dækker ifølge kritikerne kun de tokens, der forbindes med de vellykkede løsninger. Det omfatter ikke mislykkede forsøg, parallelle søgninger eller den interne beregningskraft, der blev brugt, før systemet fandt frem til et brugbart bevis .
Det omfatter heller ikke nødvendigvis den menneskelige indsats med at udvælge problemer, gennemgå argumenterne, redigere det 249 sider lange manuskript og formalisere resultaterne .
Til sammenligning kan et års stipendium til en matematikstuderende på ph.d.-niveau ved et førende universitet overstige 50.000 dollar. Sammenligningen er ikke helt retfærdig – en ph.d.-studerendes arbejde handler også om forståelse, fortolkning og langsigtet forskning – men prisforskellen illustrerer, hvorfor tallet har vakt så stor opsigt .
Matematikmiljøet er delt i vurderingen af Astra-resultaterne. Et Lean-bevis kan dokumentere korrekthed inden for et bestemt formelt system, men det garanterer ikke, at resultatet er betydningsfuldt, overraskende eller korrekt præsenteret som en løsning på det oprindelige åbne problem .
Kognitionsforskeren Gary Marcus har argumenteret for, at succes med matematik er et særtilfælde. Matematiske udsagn kan ofte kontrolleres med symbolske værktøjer, og der kan genereres store mængder syntetiske træningsdata med kendte korrekte svar. Det gælder ikke i samme grad for åbne problemer i den virkelige verden, hvor målene kan være uklare, og hvor resultaterne ikke kan kontrolleres med en tilsvarende mekanisk facitliste .
Hans pointe er derfor, at stærke resultater på ét område ikke automatisk viser, at et system har bred, generaliserbar ræsonneringsevne.
Når et lukket system producerer et resultat, opstår også et spørgsmål om gennemsigtighed. Hvordan kan forskere afgøre, om et tilsyneladende nyt argument faktisk er en ukrediteret genskabelse af eksisterende arbejde? Og hvordan vurderer man den del af modellens søgning, som ikke blev offentliggjort?
Lean kan kontrollere det formelle bevis, men ikke nødvendigvis hele den historiske og faglige kontekst .
OpenAI har endnu ikke gjort Astra offentligt tilgængelig, offentliggjort et modelkort eller oplyst fejlprocenten bag tallet på 2.000 dollar . Annonceringen kom kort efter den såkaldte Leiden-erklæring fra juni 2026, hvor matematikere kritiserede AI-virksomheder for at offentliggøre videnskabelige påstande gennem pressemeddelelser i stedet for traditionel fagfællebedømmelse .
Skeptikere har desuden henvist til tidligere AI-påstande om matematiske gennembrud, blandt andet fra Google DeepMind, som senere blev mødt med nærmere granskning .
Hvis resultaterne holder efter uafhængig kontrol, kan konsekvenserne blive betydelige – uden at det nødvendigvis betyder, at matematikere bliver overflødige.
Thomas Bloom, matematiker ved University of Manchester og ansvarlig for webstedet erdosproblems.com, kaldte resultaterne "store nyheder", men afviste samtidig forestillingen om, at AI dermed erstatter matematikere. Han fremhævede, at systemet bygger på mere end et århundredes matematisk teori og er udviklet af mennesker med matematisk ekspertise .
Den mest nøgterne konklusion er derfor ikke nødvendigvis, at AI uden videre har løst ti berømte problemer. Det er, at OpenAI har offentliggjort ti konkrete matematiske påstande med mere kontrolmateriale end et almindeligt benchmark eller en pressemeddelelse normalt indeholder. Det næste afgørende skridt er, at uafhængige matematikere vurderer, om de formelle udsagn faktisk svarer til de tilsigtede problemer – og om resultaterne fortjener den historiske betydning, som annonceringen lægger op til .