BootLoops 1.0 er et open source-værktøj, der hjælper sprogmodeller med præcise videnskabelige beregninger ved at indbygge kontrolpunkter i arbejdsgangen. Værktøjet er udviklet af Harvard-fysikeren Matthew Schwartz i samarbejde med Claude, men er ikke bundet til én bestemt AI-model. Målet er ikke at gøre alle AI-svar troværdige per automatik, men at gøre konkrete resultater lettere at teste.
11
2
Sådan bliver beregningerne efterprøvet
BootLoops samler videnskabelig software med procedurer for, hvornår et resultat kan betragtes som kontrolleret. Det kan blandt andet indebære, at resultatet sammenlignes med en uafhængig beregningsmetode på punkter, der ikke blev brugt til at tilpasse det. En positiv kontrol skal samtidig vise, at testen faktisk kan afsløre et forkert resultat. Værktøjets retningslinjer omfatter også dokumentation af, hvilke værktøjer der har bidraget til beregningen, så et værktøj ikke ender med at godkende sit eget arbejde.
2
11
Metoden egner sig især til opgaver med klart definerede svar, for eksempel beregninger inden for matematisk fysik. Den kan give belæg for, at et resultat har bestået bestemte tests. Men den beviser ikke, at alle påstande fra en sprogmodel er korrekte, eller at selve forskningsspørgsmålet er vigtigt.
2
5
Resultater fra arbejdet med Claude
Schwartz’ team rapporterede, at de beregnede 30 integraler inden for matematisk fysik. 15 af resultaterne blev beskrevet som nye, heriblandt elliptiske Feynman-integraler. Arbejdet omfattede også en løsning på det, Schwartz kalder Watsons »sidste problem« – en beregning knyttet til matematikeren George Watsons tidligere arbejde.
14
16
4
Den bredere indsats blev rapporteret at have ført til 36 manuskripter med 19 medforfattere på tværs af 18 fagområder, herunder økologi og populationsgenetik. Det er rapporterede forskningsresultater, ikke en garanti for, at hvert enkelt resultat er blevet uafhængigt efterprøvet. Schwartz har oplyst, at flere af dem stadig var under kontrol.
3
15
4
Hvorfor forskere stadig er nødvendige
Schwartz bruger udtrykket »impedansmismatch« om den dårlige pasform mellem det, forskere har brug for, og det, nutidens sprogmodeller er gode til. Modeller kan være nyttige til afgrænsede beregninger, hvor både problemet og kontrollen er tydeligt defineret. Men videnskabeligt arbejde handler også om at vælge, hvilke spørgsmål der er værd at stille, og om at vurdere, hvad et svar betyder.
1
5
Ifølge Schwartz fandt Claude forbindelser på tværs af fagområder, som ofte var teknisk korrekte, men ikke nødvendigvis videnskabeligt interessante. Fageksperter hjalp med at styre arbejdet hen mod spørgsmål, der havde betydning inden for de enkelte felter. Skellet er vigtigt: Beregningskontrol kan vise, om en udregning består bestemte tests, mens faglig dømmekraft hjælper med at afgøre, hvad man bør beregne, og hvordan resultatet skal forstås.
5
Hvad BootLoops kan – og ikke kan – fastslå
BootLoops tilbyder en måde at strukturere AI-assisteret forskning omkring opgaver, der kan testes, uafhængige kontroller og menneskelig ekspertise. De rapporterede resultater viser mulighederne i tilgangen, men bør ikke læses som en generel garanti for korrekthed eller som en erstatning for yderligere efterprøvning. En kontrolleret beregning er ikke i sig selv et tilstrækkeligt grundlag for en beslutning med store konsekvenser: Spørgsmålet, antagelserne og følgerne kræver stadig menneskelig vurdering.
2
4
5