OpenAI trakk tilbake tre matematikkmanuskripter 7. oktober, mindre enn ett døgn etter at selskapet publiserte 722 AI-genererte manuskripter på GitHub. En fortegnsfeil i ett av arbeidene gjorde at hovedargumentet ikke holdt, og svekket samtidig to manuskripter som bygget på det. Hendelsen minner om at det å publisere et matematisk manuskript ikke er det samme som å ha fått resultatene uavhengig kontrollert.
24
35
Hva OpenAI la ut
- oktober publiserte OpenAI manuskripter laget av en intern modell som ikke er offentlig tilgjengelig. Arbeidene ble samlet i 372 familier – grupper av beslektede manuskripter som kan inneholde et hovedresultat, støttende argumenter, følgesetninger eller alternative bevis. Samlingen dekker blant annet algebra, geometri og informatikk.
1
35
38
Det er derfor ikke snakk om 722 uavhengige resultater. Flere av manuskriptene bygger på argumenter eller konstruksjoner fra andre arbeider i samme familie. Nettopp denne koblingen ble viktig da OpenAI trakk tilbake tre av dem.
1
24
Fortegnsfeilen som rammet tre manuskripter
Feilen ble oppdaget i Algebraicity of Weil classes on split abelian eightfolds. I et sentralt argument fikk en geometrisk operasjon fortegnet +1, selv om den etter manuskriptets egne konvensjoner skulle hatt fortegnet −1. Dermed brøt en kanselleringsdel av argumentet sammen, og manuskriptets konstruksjon mistet støtten fra beviset.
21
24
27
To andre manuskripter bygget på dette arbeidet: Algebraicity of Kuga–Satake Correspondences for K3 Surfaces og The rational Hodge conjecture for products of K3 surfaces. Da grunnargumentet ikke lenger holdt, kunne heller ikke de tilhørende påstandene støttes av det. OpenAI trakk derfor tilbake alle tre. Det var bevisene som sviktet – ikke en motbevisning av formodningene arbeidene tok for seg.
21
24
35
Oppdateringen av arkivet
Oppdateringen 7. oktober registrerte at tre manuskripter var trukket tilbake, at 14 andre var revidert, og at referanser var oppdatert i 13 tilhørende arbeider. Katalogen gikk dermed fra 722 til 719 manuskripter, fordelt på de samme 372 familiene.
1
24
28
GitHub-arkivet og OpenAIs informasjon om publiseringen understreker at resultatene er på ulike stadier av kontroll, og at noen kan inneholde feil. OpenAI opplyste også at selskapet hadde rådført seg med Advisory Group on Mathematics and Artificial Intelligence om hvordan arbeidet skulle deles. Det taler for å lese manuskriptene som materiale for videre gransking, ikke som en samling ferdig etablerte oppdagelser.
1
33
39
Hva Lean-kontroll kan – og ikke kan – bekrefte
Noen av resultatene i samlingen har formaliseringer i Lean. Lean er et bevisverktøy som gjør det mulig for en datamaskin å kontrollere formelle matematiske bevis. Kildene oppgir likevel ikke ett felles mål på hvor stor del av arbeidet som er formalisert: Én oversikt teller rundt 300 av 719 hovedresultater, mens en annen teller 162 av 722 manuskripter med en formalisering av hovedresultatet. Tallene gjelder ulike enheter, og betyr ikke at alle påstandene i de aktuelle manuskriptene er uavhengig kontrollert.
25
33
36
OpenAIs rådføring med rådgivergruppen og de formaliserte bevisene gir nyttig bakgrunn for å vurdere publiseringen, men fjerner ikke behovet for å undersøke de skriftlige argumentene og hva de faktisk viser. Tilbaketrekkingene viser også hvorfor det er viktig å kontrollere koblinger mellom manuskripter: En feil i et felles argument kan få følger for flere arbeider.
24
33
39
Hovedpoenget: Resultatene må fortsatt etterprøves
Tilbaketrekkingene viser at ett bestemt argument ikke holdt, og at to andre manuskripter ikke lenger kunne bygge på det. De viser ikke at resten av samlingen er feil – men heller ikke at påstandene der er riktige. Hvert resultat må vurderes for seg, med særlig blikk på beviset, forutsetningene og avhengighetene til andre arbeider.
1
21
35