BootLoops 1.0 is een open-sourcegereedschapskist voor taalmodellen die precieze wetenschappelijke berekeningen uitvoeren. Harvard-natuurkundige Matthew Schwartz ontwikkelde de tool met Claude, maar BootLoops is niet aan één AI-model gebonden. Het doel is niet om elk AI-antwoord automatisch betrouwbaar te maken, maar om specifieke resultaten beter te kunnen toetsen.
11
2
Berekeningen met ingebouwde controles
BootLoops brengt wetenschappelijke software samen met werkprotocollen die vastleggen wanneer een resultaat voldoende is gecontroleerd. Zo moet een berekening worden vergeleken met een onafhankelijke aanpak, ook op punten die niet zijn gebruikt om het antwoord passend te maken. Een positieve controle moet bovendien aantonen dat de test een fout resultaat daadwerkelijk kan opsporen. De richtlijnen besteden ook aandacht aan de herkomst van bewijs: een hulpmiddel dat bij het opstellen of aanpassen van een resultaat is gebruikt, mag niet vervolgens als onafhankelijke bevestiging daarvan gelden.
2
11
Dat maakt de aanpak vooral geschikt voor taken met een duidelijk omschreven uitkomst, zoals berekeningen in de mathematische fysica. De controles kunnen laten zien dat een resultaat bepaalde tests heeft doorstaan. Ze bewijzen niet dat elke uitspraak van een AI-model klopt, of dat de onderzoeksvraag zelf belangrijk is.
2
5
De gerapporteerde resultaten
Schwartz’ team meldt dat het 30 integralen uit de mathematische fysica heeft berekend. Daaronder waren 15 resultaten die als nieuw zijn beschreven, waaronder elliptische Feynman-integralen. Het werk omvatte ook een oplossing voor wat Schwartz het ‘laatste probleem’ van Watson noemt: een berekening die verband houdt met eerder werk van de wiskundige George Watson.
14
16
4
Over het bredere project is gemeld dat het in drie maanden 36 manuscripten opleverde, met 19 co-auteurs uit 18 vakgebieden, waaronder ecologie en populatiegenetica. Dat zijn gerapporteerde onderzoeksresultaten, geen bewijs dat elke uitkomst al onafhankelijk is bevestigd. Schwartz zei dat verschillende resultaten nog werden gecontroleerd.
3
15
4
Waarom menselijke expertise nodig blijft
Schwartz gebruikt de term ‘impedantiemismatch’ voor de slechte aansluiting tussen wat onderzoekers nodig hebben en waar huidige taalmodellen goed in zijn. Modellen kunnen nuttig zijn bij afgebakende rekentaken waarvan de vraag en de controles duidelijk vastliggen. Maar wetenschap vraagt ook om te bepalen welke vragen de moeite waard zijn en om te beoordelen wat een antwoord werkelijk betekent.
1
5
Volgens Schwartz vond Claude verbanden tussen vakgebieden die technisch gezien konden kloppen, maar wetenschappelijk niet altijd veelzeggend waren. Experts uit die vakgebieden hielpen het werk daarom te richten op vragen die er binnen hun disciplines toe doen. Dat onderscheid is belangrijk: een controle kan helpen vaststellen of een berekening bepaalde tests doorstaat, terwijl wetenschappelijke expertise nodig is om te bepalen wat je berekent en hoe je de uitkomst duidt.
5
Wat BootLoops wel en niet garandeert
BootLoops biedt een manier om AI-ondersteund onderzoek op te zetten rond toetsbare taken, onafhankelijke controles en menselijke expertise. De gerapporteerde resultaten laten zien wat die aanpak kan opleveren, maar vormen geen algemene garantie dat AI-uitkomsten kloppen en vervangen verdere verificatie niet. Een gecontroleerde berekening is op zichzelf onvoldoende grond voor een beslissing met grote gevolgen: ook de vraag, de aannames en de mogelijke consequenties vragen om menselijke beoordeling.
2
4
5