Jacobiförmodan formulerades av Ott-Heinrich Keller 1939 och är ett olöst problem inom algebraisk geometri. Den finns också med på Fieldsmedaljören Stephen Smales lista över 2000-talets stora matematiska problem . Förenklat frågar den om en polynomavbildning från C³ till C³ som överallt har en konstant, icke-noll Jacobideterminant alltid måste vara globalt inverterbar.
I 87 år hade ingen hittat vare sig ett motexempel eller ett bevis. Alpöge, som arbetar med Anthropic, använde Claude Fable 5 för att hitta en avbildning med Jacobideterminanten −2 – alltså en konstant som uppfyller förmodans villkor – men där tre olika indata ger samma utdata . Det innebär att avbildningen inte är entydigt inverterbar och därmed motbevisar förmodan.
Resultatet formaliserades i Lean 4, ett system för maskinverifierbara matematiska bevis, och kontrollerades inom ett dygn av matematiker, däribland Kevin Buzzard vid Imperial College London . Flera bedömare beskrev det som det svåraste matematiska problemet som dittills lösts med hjälp av AI .
Den 1 augusti publicerade OpenAI ett forskningsinlägg där företaget hävdade att en intern version av Astra – beskriven som bolagets ”nästa stora modell” – hade tagit fram nya resultat för tio öppna problem inom matematik och teoretisk datavetenskap . Problemen hade enligt OpenAI stått utan större framsteg i minst ett decennium, i flera fall betydligt längre.
OpenAI publicerade ett manuskript på 249 sidor tillsammans med resonemang och Lean 4-certifikat som ska kunna kontrolleras av en dator . Företaget uppskattade den sammanlagda tokenkostnaden för att hitta lösningarna till cirka 2 000 dollar räknat med API-priser .
De tio områdena och resultaten var enligt OpenAI:
På GitHub angavs antalet kvarvarande ”sorry”-markeringar till noll. Det betyder att varje steg i de formaliserade bevisen enligt repositoryt hade verifierats av Lean . Det är dock viktigt att skilja maskinverifiering av ett formellt bevis från traditionell vetenskaplig granskning av hela arbetets betydelse och tolkning.
Mindre än 24 timmar efter OpenAI:s offentliggörande skrev Levent Alpöge på X att han med den offentligt tillgängliga Claude Fable hade löst fem av samma tio problem . Det handlade alltså inte om en ännu ej lanserad modell.
Enligt Alpöge:
Alpöge hävdade inte att Fable hade löst alla tio problem. Poängen var i stället att en redan tillgänglig modell med begränsad mänsklig vägledning kunde återskapa en betydande del av Astra-resultaten .
Den exakta listan över vilka fem problem Fable löste har ännu inte offentliggjorts i sin helhet . Därför går det inte att säkert matcha varje Fable-resultat mot OpenAI:s tio påståenden.
Kostnaden blir ett konkurrensmått. OpenAI:s siffra på 2 000 dollar gör beräkningskostnaden till en central del av berättelsen . Om modeller kan ta fram nya matematiska resultat för några hundra dollar per problem flyttas flaskhalsen från upptäckt till kontroll, förklaring och tolkning.
Formella bevis får större tyngd. Både Jacobiförmodan och Astra-resultaten kopplades till Lean 4 . Ett bevis som kan kontrolleras steg för steg av en maskin kan granskas på timmar eller dagar, snarare än att enbart förlita sig på att ett fåtal experter manuellt hittar dolda fel.
Det betyder inte automatiskt att traditionell sakkunniggranskning blir överflödig. Lean kan kontrollera att en formaliserad kedja av steg följer reglerna, men människor måste fortfarande bedöma om rätt problem formaliserats, hur betydelsefullt resultatet är och om slutsatserna verkligen motsvarar de ursprungliga påståendena.
Vem står som upphovsperson? Jacobiförmodan väckte också frågor om akademiskt författarskap. Är det matematikern som formulerade uppgiften, modellen som hittade konstruktionen eller företaget som byggde modellen? Alpöge tackade både en mänsklig kollega och Claude Fable 5 . Vetenskapliga tidskrifter har ännu ingen enhetlig praxis för AI som medförfattare, och resultaten spreds via X och GitHub snarare än genom en färdig artikel i en traditionell tidskrift .
Matematiker har beskrivit utvecklingen som ”mycket snabb och desorienterande” . Det mest omvälvande är kanske inte att AI ibland hittar ett svar, utan att flera modeller nu tycks kunna arbeta med abstrakta problem där mänskliga forskare har kört fast i årtionden.
Både OpenAI:s och Alpögés uppgifter är i nuläget offentliggjorda påståenden från företag respektive forskare. De har ännu inte genomgått fullständig traditionell sakkunniggranskning . Lean-certifikaten ger ett viktigt lager av maskinverifierbar säkerhet, men de ersätter inte all vetenskaplig prövning.
För Fables fem resultat saknas dessutom en fullständig offentlig kartläggning . Det är därför för tidigt att slå fast exakt hur stor del av Astra:s prestation som faktiskt har duplicerats, eller hur många av bevisen som är genuint oberoende.
Klart är däremot att AI-kapplöpningen nu handlar om mer än modellernas svar på tester. Den handlar om huruvida systemen kan producera nya, kontrollerbara forskningsresultat – och om OpenAI eller Anthropic först kan övertyga matematikerna om att resultaten håller.