Väite on herättänyt innostusta, mutta myös varovaisuutta. Keskeinen kysymys ei ole enää vain se, pystyykö tekoäly tuottamaan vakuuttavan näköisiä matemaattisia perusteluja, vaan myös se, mitä täsmälleen ratkaistiin ja miten merkittävä tulos todella on.
OpenAI:n raportin mukaan tulokset kattavat kahdeksan matematiikan ja teoreettisen tietojenkäsittelytieteen alaa. Mukana on todistuksia, vastaesimerkkejä ja aiempaa parempia ylärajoja .
Kyse ei siis ollut tavanomaisesta matematiikan kilpailutehtävästä, jonka oikea vastaus tunnetaan jo etukäteen. OpenAI kertoo mallin tuottaneen uusia tuloksia ongelmiin, joiden pääkysymyksissä ei ollut tapahtunut merkittävää edistystä ainakaan kymmeneen vuoteen .
OpenAI ei jättänyt arviointia pelkästään mallin omien vastausten varaan. Jokaisen tuloksen yhteydessä julkaistiin Lean 4 -muodollinen todistussertifikaatti. Lean on todistusavustin: ohjelmisto tarkistaa muodollisen todistuksen jokaisen loogisen askeleen lähtöoletuksista johtopäätökseen asti. Näin se voi havaita esimerkiksi aukkoja, tyyppivirheitä ja ristiriitaisia päättelyaskelia .
OpenAI:n GitHub-julkaisussa kaikkien kymmenen todistuksen sorry-merkintöjen määrä on nolla. Merkintä tarkoittaa Leanissa todistamatonta kohtaa, joten nollamäärä kertoo, että julkaistut muodolliset todistukset ovat järjestelmän sisällä kokonaan tarkistettuja .
Tämä on merkittävä ero aiempiin tekoälyn matemaattisiin väitteisiin, joissa ulkopuolisten on usein pitänyt luottaa mallin tuottamaan tekstiin. Lean-tiedostot ovat ainakin periaatteessa kenen tahansa ladattavissa ja tarkistettavissa tavallisella tietokoneella.
Muodollisella varmistuksella on kuitenkin rajansa. Lean voi vahvistaa, että tietty muodollinen väite seuraa sille annetuista määritelmistä ja aksioomista. Se ei yksinään kerro, vastaako muodollinen väite matemaatikkojen tarkoittamaa alkuperäistä ongelmaa, onko tulos todella uusi tai kuvaako OpenAI:n tiedote sitä täsmällisesti .
Asiantuntijoiden on siksi edelleen tarkistettava muun muassa määritelmät, pelkistykset, tulosten uutuus ja epämuodollisen matemaattisen argumentin yhteys Lean-muotoiluun .
OpenAI:n ilmoittama summa on helposti näyttävä, mutta sitä on tulkittava tarkasti. Yhtiö sanoi, että kymmenen onnistuneen ratkaisun tuottamiseen käytettyjen tokenien kustannus olisi Sol API -hinnoilla ollut noin 2 000 dollaria .
Se ei tarkoita, että koko tutkimusohjelma olisi maksanut 2 000 dollaria. Summa ei sisällä epäonnistuneita yrityksiä, rinnakkaisia hakuja, mallin koulutusta, palvelinkeskuksia, tutkijoiden työtä, ongelmien valintaa, käsikirjoitusten valmistelua tai todistusten muodollistamiseen ja tarkistamiseen käytettyä laskentaa . OpenAI ei myöskään ole ilmoittanut, kuinka monta yritystä tarvittiin ennen onnistuneiden ratkaisujen löytymistä.
Siksi kyse on ennen kaikkea onnistuneiden ratkaisujen laskennallisesta tokenikustannuksesta, ei koko työn todellisesta hinnasta. Silti luku on huomionarvoinen: jos tulokset kestävät riippumattoman arvioinnin, se viittaa siihen, että kehittyneet tekoälyjärjestelmät voivat tehdä osasta tutkimuksen ideointi- ja todistushakua aiempaa halvempaa .
Lean-todistus voi osoittaa muodollisen todistuksen oikeellisuuden annetussa järjestelmässä, mutta se ei automaattisesti tee tuloksesta merkittävää tai yllättävää. Tutkijoiden on arvioitava, ratkaiseeko tulos todella sen avoimen ongelman, johon sen väitetään vastaavan .
Kognitiotieteilijä Gary Marcus on korostanut, että matematiikan menestys voi olla erityistapaus. Matematiikassa symboliset työkalut mahdollistavat ulkoisen tarkistamisen, ja oikeaksi tiedettyä synteettistä aineistoa voidaan tuottaa suuria määriä. Tämä ei hänen mukaansa tarkoita, että vastaava luotettavuus ulottuisi automaattisesti esimerkiksi biologiaan, yhteiskunnallisiin päätöksiin tai avoimiin reaalimaailman ongelmiin .
Vaikka Lean auttaa tarkistamaan muodollisia todistuksia, avoimeksi jää kysymys siitä, miten arvioidaan mustan laatikon mallin alkuperä, työskentelytapa ja mahdollinen aiemman tutkimuksen uudelleenrakentaminen ilman asianmukaista tunnustusta .
OpenAI julkaisi tulokset yhtiön omana ilmoituksena, ei perinteisen vertaisarvioidun tiedejulkaisun kautta. Tämä herätti kritiikkiä erityisesti sen jälkeen, kun matemaatikot olivat kesäkuussa 2026 julkaisseet niin sanotun Leidenin julistuksen ja arvostelleet tekoäly-yhtiöitä tutkimustulosten ilmoittamisesta lehdistötiedotteilla vertaisarvioinnin sijaan .
Astraa ei ole julkaistu yleisölle, yhtiö ei ole toimittanut mallikorttia eikä se ole kertonut, kuinka suuri epäonnistuneiden yritysten osuus oli 2 000 dollarin laskelman taustalla . Myös aiempien tekoälymatematiikkaa koskevien väitteiden, kuten DeepMindin AlphaGeometry-järjestelmän, myöhempi tarkastelu on lisännyt varovaisuutta .
Jos tulokset vahvistuvat riippumattomassa arvioinnissa, Astra nostaa rimaa sille, mitä tekoälyn ”matematiikan tekemisellä” tarkoitetaan. Kilpailutehtävien ratkaisemisen sijaan kyse olisi uusista tuloksista avoimiin ongelmiin, jotka vievät tieteen rajaa eteenpäin .
Mahdolliset vaikutukset ovat kuitenkin kaksijakoiset:
Varovaisin johtopäätös on siis tämä: OpenAI on julkaissut poikkeuksellisen laajan ja tavallista paremmin tarkistettavissa olevan kokoelman tekoälyn tuottamia matemaattisia väitteitä. Lean-todistukset nostavat näyttötaakkaa, mutta lopullinen arvio siitä, ratkaisiko Astra todella kymmenen merkittävää avointa ongelmaa, kuuluu edelleen riippumattomille matemaatikoille.