Det gör beskedet uppseendeväckande – men det betyder inte att hela forskningsprojektet kostade 2 000 dollar eller att matematikkåren redan har godkänt alla anspråk.
Resultaten spänner över åtta områden och består av bevis, motexempel och förbättrade övre gränser . Bland de mest uppmärksammade finns:
Det är alltså inte fråga om att Astra bara klarade fler uppgifter från ett standardiserat test. OpenAIs anspråk gäller nya resultat på problem där den centrala frågan inte hade sett framsteg på minst ett decennium .
OpenAI nöjde sig inte med att publicera modellens svar. För varje resultat finns ett formellt beviscertifikat i Lean 4 – en fil som kan kontrolleras av en dator och i princip verifieras självständigt på en vanlig laptop .
Lean är en så kallad bevisassistent. Den kontrollerar de logiska stegen från antaganden och axiom till slutsats och kan upptäcka bland annat luckor, typfel och inkonsekvenser . I det publicerade kodförrådet är antalet sorry noll för de tio bevisen. I Lean markerar sorry steg som ännu inte är bevisade, vilket innebär att de formaliserade bevisen enligt kodförrådet inte innehåller sådana luckor .
Det höjer bevisvärdet jämfört med ett vanligt AI-svar, men löser inte alla granskningsfrågor. Lean kan kontrollera att ett formellt påstående följer av de definitioner och axiom som angetts. Verktyget kan däremot inte avgöra om:
Forskare behöver därför fortfarande granska formuleringar, definitioner, reduktioner, nyhetsanspråk och övergången mellan den informella matematiska idén och den formella koden .
OpenAI uppger att tokens för att generera de tio framgångsrika lösningarna skulle ha kostat ungefär 2 000 dollar enligt Sol API:s prisnivå . Det är en kostnad motsvarande den mängd tokens som användes för att hitta lösningarna – inte den totala kostnaden för att utveckla Astra eller genomföra hela forskningsprogrammet.
Siffran inkluderar inte nödvändigtvis misslyckade försök, parallella sökningar eller den interna beräkningskraft som användes innan en lösning med certifikat hittades . Den säger inte heller vad det kostade att träna modellen, välja problemen, bearbeta argumenten, skriva det 249 sidor långa manuskriptet eller låta forskare kontrollera materialet .
Det är därför mer korrekt att kalla siffran ett API-ekvivalent pris för lösningssökningen än en komplett prislapp för forskningen. Trots det är kostnaden slående låg jämfört med den mänskliga tid som normalt krävs för avancerad matematisk forskning. Ett doktorandstipendium i matematik vid ett ledande universitet kan överstiga 50 000 dollar per år .
Reaktionerna har varit blandade. Vissa bedömare ser resultaten som ett viktigt steg för AI-assisterad forskning, medan andra anser att OpenAIs presentation går längre än vad det publicerade underlaget ännu kan bära .
Formella bevis är inte samma sak som vetenskaplig konsensus. Ett Lean-certifikat kan visa att en viss formaliserad sats är korrekt inom systemets ramar. Det bevisar inte automatiskt att Astra har löst exakt det öppna problem som rubrikerna syftar på, eller att resultatet är matematiskt banbrytande .
Den kognitionsvetenskapliga forskaren Gary Marcus har samtidigt argumenterat för att framgång inom matematik är ett specialfall. Matematik lämpar sig särskilt väl för symboliska verktyg och maskinell verifiering, vilket inte innebär att samma tillförlitlighet gäller i alla vetenskapliga eller praktiska domäner .
En annan fråga gäller hur AI-genererad matematik ska granskas och tillskrivas. När en modell är en sluten företagsprodukt är det svårt att bedöma hur sökprocessen gått till och om ett påstått nytt resultat i själva verket återupptäcker tidigare arbete utan korrekt hänvisning .
Kritiken har också riktats mot bristen på traditionell kollegial granskning. Beskedet kom kort efter Leiden-deklarationen i juni 2026, där matematiker kritiserade AI-företag för att presentera forskningsresultat genom pressmeddelanden i stället för genom peer review . Astra har ännu inte släppts offentligt, OpenAI har inte publicerat något modellkort och företaget har inte redovisat någon framgångsfrekvens bakom kostnadssiffran på 2 000 dollar .
Tidigare AI-anspråk inom matematik, bland annat kring Googles DeepMind-system AlphaGeometry, har dessutom granskats kritiskt i efterhand. Det är ett skäl att invänta oberoende matematikers bedömning innan beskedet beskrivs som ett definitivt paradigmskifte .
Om resultaten håller för oberoende granskning kan den största förändringen vara att avancerad matematisk idé- och bevisprövning blir betydligt billigare. Små forskargrupper och enskilda matematiker skulle kunna använda AI för att testa fler hypoteser och utforska tekniska riktningar som tidigare krävde åratal av arbete .
Samtidigt väcker utvecklingen frågor om vem som kontrollerar framtidens forskningsinfrastruktur. Om banbrytande matematisk upptäckt blir beroende av tillgång till privata API:er kan en större del av den grundläggande forskningen flyttas från universitet och offentliga institutioner till kommersiella AI-bolag .
Det behövs också gemensamma standarder för hur AI-genererade bevis ska bedömas, krediteras och sakkunniggranskas – särskilt när modellen som hittade idén inte är öppen för insyn .
Thomas Bloom, matematiker vid University of Manchester, har kallat resultaten ”stora nyheter”, men avvisar samtidigt bilden av att AI därmed ersätter matematiker. Astra bygger på mer än ett sekel av matematisk teori och har utvecklats av människor med matematisk expertis .
Den försiktiga slutsatsen är därför inte att AI redan självständigt har ersatt matematisk forskning. Snarare har OpenAI publicerat tio konkreta resultat med ovanligt mycket verifieringsmaterial. Lean gör anspråken mer testbara än ett vanligt pressmeddelande – men det återstår för oberoende experter att avgöra hur väl resultaten motsvarar de ursprungliga problemen, hur nya de är och hur betydelsefulla de blir.