OpenAI stáhlo 7. října tři matematické rukopisy, méně než den poté, co na GitHubu zveřejnilo 722 textů vytvořených interním modelem, který firma veřejnosti nezpřístupnila. V jednom z rukopisů se objevila chyba ve znaménku: narušila klíčový argument a tím i dva další texty, které na něm stavěly. Zveřejnit matematický rukopis ale není totéž jako nezávisle ověřit jeho tvrzení.
24
35
Co OpenAI zveřejnilo
Dne 6. října OpenAI publikovalo rukopisy vytvořené interním modelem. Soubory rozdělilo do 372 skupin souvisejících výsledků, takzvaných rodin. Jedna rodina může zahrnovat hlavní výsledek, navazující argumenty, důsledky nebo alternativní důkazy. Kolekce se věnuje mimo jiné algebře, geometrii a informatice.
1
35
38
Číslo 722 tedy neznamenalo 722 nezávislých objevů. Některé rukopisy se opíraly o argumenty či konstrukce popsané v jiných textech stejné skupiny. Právě tato provázanost vedla k tomu, že chyba v jednom důkazu měla dopad na tři rukopisy.
1
24
Chyba ve znaménku narušila tři důkazy
Problém se objevil v textu Algebraicity of Weil classes on split abelian eightfolds. V klíčové části argumentu autoři přiřadili určité geometrické operaci znaménko +1, ačkoli podle konvencí použité v rukopisu mělo jít o −1. Tím se narušil argument založený na vzájemném vyrušení členů, který měl podpořit navrženou konstrukci.
21
24
27
O tento text se opíraly další dva rukopisy: Algebraicity of Kuga–Satake Correspondences for K3 Surfaces a The rational Hodge conjecture for products of K3 surfaces. Když se ukázalo, že původní argument neobstojí, nebylo možné o něj opřít ani tvrzení v těchto dvou textech. OpenAI proto stáhlo všechny tři. Šlo o selhání argumentů v rukopisech, nikoli o vyvrácení samotných hypotéz, kterými se zabývaly.
21
24
35
Co se změnilo v katalogu
Aktualizace z 7. října oznámila stažení tří rukopisů, úpravy dalších 14 textů a aktualizaci odkazů ve 13 doprovodných rukopisech. Katalog se zmenšil ze 722 na 719 rukopisů, nadále však obsahoval 372 tematických skupin.
1
24
28
V repozitáři i materiálech OpenAI se uvádí, že výsledky jsou v různých fázích ověření a některé mohou obsahovat chyby. Firma také uvedla, že při zveřejňování vycházela z konzultací s poradní skupinou pro matematiku a umělou inteligenci. To je důležitý kontext: rukopisy je namístě chápat jako materiál k posouzení, ne jako soubor hotových a potvrzených objevů.
1
33
39
Co ověření v Lean může — a nemůže — potvrdit
Ke kolekci patří také formální důkazy zapsané v jazyce Lean, který umožňuje počítačově kontrolovat formálně vyjádřené matematické důkazy. Dostupné přehledy ale uvádějí různá čísla a počítají různé věci: jeden zmiňuje přibližně 300 z 719 hlavních výsledků převedených do Lean, zatímco jiný uvádí 162 z 722 rukopisů s formalizací hlavního výsledku. Tyto údaje používají odlišné jednotky, a proto je nelze přímo srovnávat. Ani jeden neznamená, že každý nárok v příslušném rukopisu prošel nezávislým ověřením.
25
33
36
Konzultace s poradní skupinou i formalizované důkazy jsou užitečným kontextem pro hodnocení zveřejněné práce. Samy o sobě ale nenahrazují kontrolu psaných argumentů ani ověření toho, co přesně důkaz pokrývá. Stažení tří textů navíc připomíná, že je potřeba prověřovat i vazby mezi rukopisy: chyba ve společném argumentu se může přenést do více prací.
24
33
39
Zveřejnění není totéž co potvrzený výsledek
Stažení ukazuje, že konkrétní argument neobstál a dva navazující rukopisy se o něj nemohly opřít. Neříká ale, že ostatní texty jsou chybné — ani že jsou správné. Každý výsledek je třeba posoudit samostatně, se zřetelem k důkazu, jeho předpokladům i závislostem na souvisejících pracích.
1
21
35