Według raportu OpenAI wyniki obejmowały osiem obszarów matematyki i teoretycznej informatyki. Znalazły się wśród nich dowody, kontrprzykłady oraz lepsze oszacowania .
Nie chodziło więc wyłącznie o rozwiązywanie zadań konkursowych, takich jak problemy z Międzynarodowej Olimpiady Matematycznej. OpenAI przedstawiło wyniki dotyczące pytań, które miały pozostawać na granicy aktualnej wiedzy badawczej .
OpenAI nie poprzestało na opublikowaniu tekstu wygenerowanego przez model. Do każdego wyniku dołączono formalny certyfikat dowodu w Lean 4 — plik, który można niezależnie zweryfikować na komputerze .
Lean jest asystentem dowodzenia. Sprawdza kolejne kroki od przyjętych aksjomatów i definicji aż do wniosku, wykrywając m.in. luki logiczne, błędy typów i niespójności . Wszystkie pliki udostępniono publicznie na GitHubie na licencji Apache 2.0. W repozytorium licznik sorry, oznaczający nieudowodnione fragmenty, miał wynosić zero dla wszystkich 10 dowodów .
To istotnie podnosi wiarygodność techniczną rezultatów, ale nie zamyka całej dyskusji. Lean może potwierdzić, że formalny wniosek wynika z określonych formalnych definicji. Nie jest natomiast w stanie samodzielnie stwierdzić, czy:
Dlatego eksperci nadal muszą sprawdzić zgodność sformułowań, definicje, redukcje, nowość wyników oraz przejście między nieformalnym argumentem a jego wersją formalną .
Według OpenAI tokeny potrzebne do znalezienia wszystkich 10 rozwiązań kosztowałyby około 2000 dolarów przy przeliczeniu według stawek API Sol . To nie jest koszt zbudowania Astry ani całego programu badawczego.
Podana kwota nie obejmuje nieudanych prób, równoległych eksperymentów, poszukiwań prowadzonych przed znalezieniem certyfikatu ani kosztów pracy badaczy, którzy opracowali argumenty w formie manuskryptów i przygotowali ich formalizację . Właściwe pytanie brzmi więc nie tylko „ile kosztowało 10 sukcesów”, lecz także „ile prób wykonano, zanim te sukcesy osiągnięto?”. OpenAI nie podało współczynnika skuteczności ani pełnego rachunku obliczeń .
Mimo tych zastrzeżeń sama skala kwoty przyciągnęła uwagę. Dla porównania, roczne stypendium doktoranta matematyki na czołowym uniwersytecie może przekraczać 50 tysięcy dolarów . Takie zestawienie nie jest jednak bezpośrednim porównaniem całkowitych kosztów badań — pokazuje przede wszystkim różnicę między kosztem wygenerowania wybranych wyników a kosztem wieloletniej pracy badawczej.
Środowisko matematyczne nie oceniło ogłoszenia jednomyślnie. Certyfikat Lean może potwierdzać poprawność formalnego dowodu, ale nie gwarantuje, że wynik jest ważny, zaskakujący lub właściwie przedstawiony jako rozwiązanie konkretnego problemu otwartego . Ostateczna ocena wymaga niezależnej analizy specjalistów.
Kognitywista Gary Marcus argumentował, że „sukces w matematyce jest szczególnym przypadkiem”. Jego zdaniem sprawność w jednej dziedzinie nie dowodzi jeszcze ogólnej zdolności rozumowania ani niezawodności we wszystkich obszarach nauki . Matematyka szczególnie dobrze nadaje się do automatycznego sprawdzania za pomocą narzędzi symbolicznych, czego nie da się w prosty sposób przenieść na problemy otwarte, nieprecyzyjne lub zależne od świata rzeczywistego .
Pojawia się również bardziej fundamentalne pytanie: jak oceniać matematykę stworzoną przez model, którego wewnętrzne działanie jest nieprzejrzyste? Nie ma uzgodnionej metody pozwalającej rozstrzygnąć, czy rezultat czarnej skrzynki jest niezależnym odkryciem, czy nieujawnioną rekonstrukcją znanej pracy .
Astra nie została jeszcze udostępniona publicznie. OpenAI nie opublikowało karty modelu ani powtarzalnych, publicznych benchmarków pokazujących jego skuteczność . Ogłoszenie nastąpiło niedługo po opublikowaniu w czerwcu 2026 roku tzw. Deklaracji z Lejdy, w której matematycy krytykowali firmy AI za ogłaszanie odkryć w formie komunikatów prasowych zamiast poddawania ich standardowej recenzji naukowej .
Sceptycy przypomnieli też wcześniejsze deklaracje dotyczące osiągnięć AI w matematyce, w tym AlphaGeometry firmy Google DeepMind, które później poddawano szczegółowej analizie . Nie oznacza to, że wyniki Astry są błędne. Oznacza natomiast, że ich znaczenie powinno zostać ocenione przez niezależnych matematyków, a nie wyłącznie na podstawie prezentacji producenta.
Jeśli rezultaty Astry przejdą niezależną kontrolę, ich najważniejszym skutkiem może być obniżenie kosztu poszukiwania dowodów i testowania hipotez. Małe zespoły, a nawet pojedynczy badacze, mogliby korzystać z narzędzi AI przy zadaniach, które wcześniej wymagały lat specjalistycznej pracy .
Jednocześnie pojawia się ryzyko uzależnienia infrastruktury badań matematycznych od prywatnych, płatnych modeli. Jeżeli najbardziej zaawansowane odkrycia będą wymagały dostępu do zamkniętych API, część podstawowej infrastruktury naukowej może przesunąć się z uniwersytetów i instytucji publicznych do firm technologicznych .
Potrzebne będą również nowe standardy dotyczące autorstwa, przypisywania zasług, ujawniania nieudanych prób oraz recenzowania dowodów wygenerowanych przez AI. Sam fakt, że plik Lean przechodzi kontrolę, nie odpowiada jeszcze na pytanie, kto dokonał odkrycia i jak należy ocenić jego wartość naukową .
Thomas Bloom, matematyk z University of Manchester, określił wyniki jako „wielką wiadomość”, ale odrzucił tezę, że AI zastępuje matematyków. Zwrócił uwagę, że model korzysta z ponad stulecia rozwoju teorii matematycznych i został zbudowany przez matematyków . Najostrożniejszy wniosek jest więc bardziej konkretny niż hasło o „końcu matematyki”: Astra może oznaczać znaczący postęp w automatyzacji poszukiwania i formalizowania dowodów, ale dopiero niezależna weryfikacja pokaże, jak przełomowe są przedstawione wyniki.