Het Jacobiaanvermoeden werd in 1939 geformuleerd door Ott-Heinrich Keller. Het is een open probleem binnen de algebraïsche meetkunde en staat op plaats 16 van de lijst met 21e-eeuwse problemen van Fieldsmedaillewinnaar Stephen Smale . In eenvoudige bewoordingen vraagt het vermoeden of een polynoomfunctie van (\mathbb{C}^3) naar (\mathbb{C}^3) die overal een constante, niet-nul Jacobiaandeterminant heeft, automatisch wereldwijd omkeerbaar is.
Al 87 jaar was er geen bewijs voor of tegen gevonden. Alpöge werkte met Claude Fable 5 aan een functie (F=(P,Q,R):\mathbb{C}^3\to\mathbb{C}^3) met een constante Jacobiaandeterminant van −2. Toch stuurde die functie drie verschillende invoeren naar dezelfde uitvoer. Daarmee vormde ze een concreet tegenvoorbeeld en werd het vermoeden rechtstreeks weerlegd .
Het resultaat werd geformaliseerd in Lean 4, een systeem waarmee wiskundige bewijzen stap voor stap door een computer kunnen worden gecontroleerd. Wiskundigen, onder wie Kevin Buzzard van Imperial College London, verifieerden het resultaat volgens de berichtgeving binnen een dag . Het werd breed omschreven als het moeilijkste wiskundige probleem dat tot dan toe met hulp van AI was opgelost .
Op 1 augustus 2026 publiceerde OpenAI een onderzoeksbericht over Astra, dat het bedrijf omschrijft als zijn volgende grote modellijn. Een interne versie zou nieuwe resultaten hebben geleverd voor tien open problemen in de wiskunde en theoretische informatica. Bij al die problemen was er minstens tien jaar weinig of geen vooruitgang geboekt .
OpenAI publiceerde daarnaast een manuscript van 249 pagina’s, redeneringsuitleg die door het model was opgesteld en Lean 4-certificaten op GitHub. Volgens het bedrijf bedroegen de tokenkosten voor het vinden van alle tien oplossingen ongeveer 2.000 dollar, berekend tegen API-tarieven .
De tien gemelde resultaten bestrijken onder meer:
In de GitHub-repository stond de zogenoemde “sorry”-teller op nul. In Lean betekent dat dat er geen onbewezen stappen in de geformaliseerde bewijzen zijn achtergelaten . Dat maakt de resultaten controleerbaar door een computer, maar het neemt niet automatisch alle vragen weg over de interpretatie, reikwijdte en wetenschappelijke betekenis van de claims.
Binnen 24 uur na de aankondiging van OpenAI reageerde Alpöge op X. Hij zei dat hij met het publiek beschikbare Claude Fable — dus niet met een geheim of nog niet uitgebracht model — vijf van dezelfde tien problemen onafhankelijk had opgelost .
Volgens Alpöge gebruikte hij algemene prompts, zonder internettoegang. Er waren bovendien maatregelen genomen om te voorkomen dat Fable de oplossingen van OpenAI kon zien . Het model zou de resultaten binnen enkele uren autonoom hebben geproduceerd .
De gemelde oplossingen hadden betrekking op onder meer:
Alpöge beweerde niet dat Fable alle tien problemen had opgelost. Zijn punt was dat een model dat al voor het publiek beschikbaar is, volgens zijn test de helft van Astra’s resultaten kon reproduceren met minimale menselijke begeleiding . Van de vijf oplossingen zou er maar één in wezen hetzelfde argument gebruiken; de andere vier zouden mogelijk onafhankelijke bewijzen zijn .
Daarmee wordt de manier waarop OpenAI Astra positioneert ter discussie gesteld. Een nog niet uitgebracht model dat tien resultaten claimt, is indrukwekkend. Maar als een publiek model er kort daarna vijf kan evenaren, verschuift de discussie van pure modelkracht naar reproduceerbaarheid, kosten en de precieze omstandigheden van de experimenten.
Kosten worden een nieuwe concurrentiefactor. Het bedrag van 2.000 dollar is vooral interessant omdat het de kosten van geautomatiseerde ontdekking zichtbaar maakt . Als AI-systemen nieuwe wiskundige resultaten kunnen genereren voor enkele honderden dollars per probleem, ligt de grootste uitdaging mogelijk niet langer bij het vinden van ideeën, maar bij het controleren en begrijpen ervan.
Machinecontroleerbare bewijzen worden belangrijker. Zowel het werk rond het Jacobiaanvermoeden als de Astra-resultaten werd in Lean 4 geformaliseerd . Daardoor kan software controleren of afzonderlijke stappen logisch volgen. Dat de verificatie in uren of dagen kan plaatsvinden in plaats van in jaren, wijst op een toekomst waarin formele certificaten voor bepaalde soorten resultaten een veel grotere rol krijgen naast traditionele peer review .
De rol van menselijke onderzoekers blijft centraal. De claim “AI loste een probleem op” beschrijft niet noodzakelijk een volledig autonome ontdekking. In het geval van het Jacobiaanvermoeden werkte Alpöge gericht met het model, waarna het resultaat door mensen werd onderzocht en geformaliseerd. Ook bij Astra werden de argumenten volgens de berichtgeving tot manuscripten verwerkt met hulp van mensen en hetzelfde model .
Auteurschap is nog niet geregeld. Het Jacobiaanresultaat riep meteen de vraag op wie als auteur moet gelden: de wiskundige die het probleem aandroeg en de prompts gaf, het model dat het tegenvoorbeeld vond, of het bedrijf dat het model ontwikkelde? Alpöge bedankte op X zowel een menselijke collega als Claude Fable 5 . Wetenschappelijke tijdschriften hebben geen uniforme regels voor AI als mede-auteur. De resultaten werden bovendien eerst via sociale media en GitHub verspreid, in plaats van via een volledig afgerond peer-reviewproces .
Wiskundigen omschreven het tempo inmiddels als “very rapid and disorienting” — zeer snel en desoriënterend .
De exacte lijst van de vijf problemen die Claude Fable volgens Alpöge reproduceerde, is nog niet volledig openbaar gemaakt . Wel wordt gemeld dat de resultaten gebieden omvatten als circuitcomplexiteit, quantum parallel repetition en roostercryptografie. Welke vijf problemen precies overeenkomen met de Astra-resultaten, blijft echter onbevestigd .
Daarom moeten zowel de aankondiging van OpenAI als de tegenclaim van Alpöge voorlopig worden gelezen als resultaten die door het bedrijf en de onderzoeker zelf zijn bekendgemaakt en nog geen volledig traditioneel peer-reviewproces hebben doorlopen. De Lean-certificaten bieden een sterke laag van machinecontroleerbare zekerheid, maar onafhankelijke beoordeling blijft nodig om vast te stellen hoe ver de resultaten precies reiken .