OpenAI wycofało trzy manuskrypty matematyczne 7 października, niespełna dobę po opublikowaniu na GitHubie 722 tekstów wygenerowanych przez wewnętrzny model firmy. W jednym z nich błędny znak podważył kluczowy argument, a ponieważ od tego argumentu zależały dwie kolejne prace, wycofano całą trójkę. To przypomnienie, że udostępnienie manuskryptu nie jest równoznaczne z niezależnym potwierdzeniem jego wyników.
24
35
Co OpenAI opublikowało?
6 października OpenAI udostępniło manuskrypty przygotowane przez wewnętrzny model, którego firma nie opublikowała. Prace zebrano w 372 grupy tematycznie powiązanych tekstów — mogą one obejmować główny wynik, argumenty pomocnicze, konsekwencje lub alternatywne dowody. Kolekcja obejmuje między innymi algebrę, geometrię i informatykę.
1
35
38
Liczba 722 nie oznaczała 722 niezależnych odkryć. Część manuskryptów opierała się na argumentach lub konstrukcjach przedstawionych w innych tekstach z tej samej grupy. To właśnie ta zależność okazała się istotna przy wycofaniu trzech prac.
1
24
Błąd znaku podważył trzy manuskrypty
Problem dotyczył pracy Algebraicity of Weil classes on split abelian eightfolds. W kluczowym rozumowaniu autorzy przypisali pewnej operacji geometrycznej znak +1, choć zgodnie z przyjętymi w tekście konwencjami powinien to być −1. W efekcie nie działał argument oparty na wzajemnym znoszeniu się składników, który miał uzasadniać przedstawioną konstrukcję.
21
24
27
Na tej pracy opierały się dwa kolejne manuskrypty: Algebraicity of Kuga–Satake Correspondences for K3 Surfaces oraz The rational Hodge conjecture for products of K3 surfaces. Gdy zawiódł podstawowy argument, nie dało się już na jego podstawie uzasadnić twierdzeń w tych tekstach. OpenAI wycofało więc wszystkie trzy prace. Oznacza to, że zawiodły ich argumenty — nie że obalone zostały same hipotezy, których dotyczyły.
21
24
35
Co zmieniło się w repozytorium?
Aktualizacja z 7 października odnotowała wycofanie trzech manuskryptów, poprawki w kolejnych 14 oraz aktualizację odnośników w 13 powiązanych tekstach. Katalog zmniejszył się z 722 do 719 manuskryptów, nadal podzielonych na 372 grupy.
1
24
28
Materiały OpenAI zaznaczają, że wyniki znajdują się na różnych etapach weryfikacji i mogą zawierać błędy. Firma poinformowała również, że sposób udostępnienia prac konsultowała z Advisory Group on Mathematics and Artificial Intelligence — grupą doradczą zajmującą się matematyką i sztuczną inteligencją. Warto więc traktować kolekcję jako materiał do sprawdzenia, a nie zbiór potwierdzonych odkryć.
1
33
39
Co daje formalizacja w Lean — i czego nie gwarantuje?
Do części wyników dołączono formalizacje w Lean. To system wspomagający dowodzenie, który pozwala komputerowo sprawdzać sformalizowane dowody matematyczne. Dostępne zestawienia różnią się jednak sposobem liczenia: jedno mówi o około 300 z 719 głównych wyników zapisanych w Lean, inne — o formalizacji głównego wyniku w 162 z 722 manuskryptów. To różne jednostki, dlatego żadnej z tych liczb nie należy interpretować jako potwierdzenia wszystkich twierdzeń zawartych w odpowiadających im pracach.
25
33
36
Konsultacje z grupą doradczą i obecność sformalizowanych dowodów pomagają ocenić charakter publikacji, ale nie zastępują sprawdzenia treści tekstów ani zakresu poszczególnych twierdzeń. Wycofanie trzech manuskryptów pokazuje też, dlaczego trzeba analizować powiązania między pracami: błąd we wspólnym argumencie może podważyć więcej niż jeden tekst.
24
33
39
Najważniejszy wniosek: pozostałe wyniki nadal wymagają sprawdzenia
Wycofanie prac wskazuje, że konkretny argument był błędny, a dwóch zależnych tekstów nie można było obronić na jego podstawie. Nie dowodzi ani tego, że pozostałe manuskrypty są błędne, ani tego, że ich twierdzenia są poprawne. Każdy wynik trzeba oceniać osobno, sprawdzając dowód, założenia oraz zależności od innych prac.
1
21
35