Språkmodeller kan være gode til å gjennomføre beregninger, men et overbevisende svar er ikke automatisk et riktig svar. BootLoops 1.0 er laget for å gjøre bestemte, presise vitenskapelige beregninger lettere å kontrollere – uten å late som om verktøyet kan avgjøre hva som er god forskning.
11
2
Rammeverket er utviklet av Harvard-fysikeren Matthew Schwartz sammen med Claude. Det kombinerer vitenskapelig programvare med arbeidsrutiner som beskriver hvilke tester et resultat må bestå. BootLoops er ikke knyttet til én bestemt språkmodell.
11
2
Slik blir beregningene testet
En viktig del av opplegget er å sammenligne resultatet med en uavhengig beregningsmåte, også på punkter som ikke ble brukt til å tilpasse løsningen. En positiv kontroll skal i tillegg vise at testen faktisk kan fange opp et feilaktig resultat. Rutiner for dokumentasjon av resultatets opphav skal hindre at et verktøy som bidro til å finne svaret, også får være den eneste kontrolløren av det.
2
11
Slike krav passer særlig godt når oppgaven har et tydelig svar som kan regnes ut og kontrolleres, slik som enkelte beregninger i matematisk fysikk. Testene kan gi grunnlag for å si at et resultat besto bestemte kontroller. De garanterer ikke at alt en modell sier, er riktig, eller at forskningsspørsmålet er viktig.
2
5
Beregninger og forskning på tvers av fag
Schwartz’ team rapporterte at BootLoops ble brukt til å beregne 30 integraler innen matematisk fysikk. Av disse ble 15 omtalt som nye resultater, blant annet integraler knyttet til Feynman-diagrammer. Arbeidet omfattet også en løsning på det Schwartz kaller George Watsons «siste problem», en beregning knyttet til matematikerens tidligere arbeid.
14
16
4
Det bredere arbeidet skal ha resultert i 36 manuskripter med 19 medforfattere fra 18 fagområder, blant annet økologi og populasjonsgenetikk. Dette er rapporterte forskningsresultater, ikke en bekreftelse på at alt er ferdig uavhengig verifisert. Schwartz opplyste at flere resultater fortsatt ble kontrollert.
3
15
4
Hvorfor forskere fortsatt trengs
Schwartz bruker uttrykket «impedance mismatch» – et misforhold mellom to systemer som hver for seg fungerer, men ikke passer godt sammen – om avstanden mellom det forskere trenger, og det språkmodeller er gode til. Modeller kan egne seg til avgrensede oppgaver med tydelige krav og kontroller. Men forskning handler også om å finne ut hvilke spørsmål som er verdt å stille, og om å forstå hva et resultat faktisk betyr.
1
5
Ifølge Schwartz fant Claude forbindelser mellom fagområder som kunne være teknisk korrekte, men lite interessante for forskningen. Fageksperter bidro til å styre arbeidet mot spørsmål som hadde betydning innen de aktuelle fagfeltene. Det peker på et viktig skille: Beregninger kan testes mot spesifikke krav, mens faglig skjønn trengs for å velge hva man skal undersøke og tolke funnene.
5
Et hjelpemiddel, ikke en garanti
BootLoops viser hvordan KI-assistert forskning kan organiseres rundt oppgaver som lar seg teste, uavhengige kontroller og menneskelig fagkunnskap. Resultatene Schwartz har rapportert, illustrerer mulighetene – men er ingen generell garanti for at KI-svar er riktige, og de erstatter ikke videre verifisering.
2
4
5
Selv en kontrollert beregning er ikke alene nok til å begrunne en beslutning med store konsekvenser. Spørsmålet, forutsetningene og hva som står på spill, må fortsatt vurderes av mennesker.
2
5
4