BootLoops 1.0 to otwarty zestaw narzędzi, który ma pomagać modelom językowym wykonywać precyzyjne obliczenia naukowe w sposób możliwy do sprawdzenia. Opracował go fizyk z Harvardu Matthew Schwartz, współpracując z Claude’em. Narzędzie nie jest jednak przywiązane do jednego modelu, a jego celem nie jest automatyczne uwiarygodnianie każdej odpowiedzi AI. Ma ułatwiać testowanie konkretnych wyników.
11
2
Jak BootLoops sprawdza obliczenia
Zestaw łączy oprogramowanie naukowe z protokołami określającymi, co oznacza, że wynik został sprawdzony. Jedna z procedur wymaga porównania go z niezależną metodą obliczeń — także w punktach, które nie posłużyły do dopasowania rozwiązania. Inna wykorzystuje tzw. kontrolę pozytywną, czyli test pokazujący, że procedura potrafi wykryć błędny wynik. Wytyczne uwzględniają też pochodzenie danych i narzędzi: program, który pomógł dopasować odpowiedź, nie powinien samodzielnie jej zatwierdzać.
2
11
To podejście pasuje do zadań z jasno określonym wynikiem, takich jak obliczenia z fizyki matematycznej. Może dostarczyć dowodów, że wynik przeszedł konkretne testy, ale nie potwierdza automatycznie prawdziwości wszystkich twierdzeń wygenerowanych przez model ani wartości samego pytania badawczego.
2
5
Wyniki uzyskane z pomocą Claude’a
Zespół Schwartza poinformował o obliczeniu 30 całek z fizyki matematycznej. Wśród wyników znalazło się 15 opisanych jako nowe, w tym dotyczących eliptycznych całek Feynmana. Prace obejmowały również rozwiązanie tego, co Schwartz nazywa „ostatnim problemem” Watsona — obliczenia związanego z wcześniejszymi pracami matematyka George’a Watsona.
14
16
4
Według relacji z szerszego, trzy miesięcznego przedsięwzięcia powstało 36 manuskryptów z udziałem 19 współautorów, dotyczących 18 dziedzin, w tym ekologii i genetyki populacyjnej. To zgłoszone wyniki pracy, a nie dowód, że każdy z nich przeszedł już niezależną weryfikację: Schwartz mówił, że część rezultatów nadal jest sprawdzana.
3
15
4
Dlaczego eksperci nadal są potrzebni
Schwartz używa określenia „niedopasowanie impedancyjne”, by opisać różnicę między tym, czego potrzebują naukowcy, a tym, w czym dobrze radzą sobie obecne modele językowe. AI może być użyteczna przy ograniczonych zadaniach obliczeniowych, jeśli problem i sposób sprawdzenia odpowiedzi są jasno określone. Nauka wymaga jednak również wyboru istotnych pytań i oceny, czy uzyskany wynik ma znaczenie.
1
5
W opisie Schwartza Claude znajdował powiązania między różnymi dziedzinami, które mogły być poprawne technicznie, ale mało interesujące z punktu widzenia danej nauki. Eksperci pomagali kierować pracami ku pytaniom ważnym dla konkretnych dziedzin. To istotne rozróżnienie: kontrola obliczeń może pomóc ustalić, czy wynik przeszedł określone testy, ale to wiedza naukowców pomaga zdecydować, co warto obliczać i jak interpretować rezultat.
5
Co BootLoops potwierdza, a czego nie
BootLoops pozwala organizować pracę z AI wokół zadań, które można testować, niezależnych metod kontroli i wiedzy ekspertów. Opisane wyniki wskazują na możliwości takiego podejścia, ale nie są gwarancją bezbłędności ani zamiennikiem dalszej weryfikacji. Sam fakt, że obliczenie przeszło określone testy, nie wystarcza, by uzasadnić decyzję o poważnych konsekwencjach. Ludzie nadal muszą ocenić pytanie, założenia i możliwe skutki.
2
4
5