BootLoops 1.0 är ett öppet verktyg för att hjälpa språkmodeller med precisa vetenskapliga beräkningar – och göra resultaten lättare att kontrollera. Harvardfysikern Matthew Schwartz utvecklade det tillsammans med Claude. Verktyget är dock inte knutet till en enda AI-modell. Tanken är inte att alla AI-svar ska betraktas som tillförlitliga, utan att vissa beräkningar ska kunna prövas systematiskt.
11
2
Så gör BootLoops beräkningar kontrollerbara
Verktyget samlar vetenskaplig programvara och arbetsprotokoll som anger vad som krävs för att ett resultat ska räknas som kontrollerat. Det kan till exempel innebära att resultatet jämförs med en oberoende beräkningsmetod, även vid testpunkter som inte användes för att anpassa det. En positiv kontroll ska dessutom visa att kontrollen faktiskt kan upptäcka ett fel. Protokollen tar också upp spårbarhet: ett verktyg som bidragit till att ta fram resultatet ska inte ensamt få bekräfta samma resultat.
2
11
Det här passar särskilt bra för uppgifter med tydligt definierade svar, som beräkningar inom matematisk fysik. Kontrollerna kan ge belägg för att ett resultat klarat vissa tester. De bevisar däremot inte att varje påstående från en modell är korrekt eller att forskningsfrågan i sig är viktig.
2
5
Resultat från arbetet med Claude
Schwartz team uppger att de beräknade 30 integraler inom matematisk fysik. Av dessa beskrivs 15 resultat som nya, däribland resultat för elliptiska Feynmanintegraler. Arbetet omfattade också en lösning på det Schwartz kallar Watsons ”sista problem”, en beräkning med koppling till matematikern George Watsons tidigare arbete.
14
16
4
Under en tre månaders period rapporterades det bredare arbetet ha lett till 36 manuskript med 19 medförfattare inom 18 forskningsområden, däribland ekologi och populationsgenetik. Det är rapporterade forskningsresultat, inte ett belägg för att allt redan har verifierats oberoende. Schwartz har sagt att flera resultat fortfarande kontrollerades.
3
15
4
Varför forskare fortfarande behövs
Schwartz beskriver en ”impedansmissanpassning” mellan vad forskare behöver och vad dagens språkmodeller är bra på. Uttrycket kommer från fysiken och syftar här på att två delar kan fungera var för sig men passa dåligt ihop. Modeller kan vara användbara för avgränsade beräkningar där både uppgiften och kontrollerna är tydliga. Men forskning handlar också om att avgöra vilka frågor som är värda att ställa och vad ett svar faktiskt betyder.
1
5
Enligt Schwartz hittade Claude samband mellan olika forskningsfält som kunde vara tekniskt korrekta men ändå inte särskilt intressanta för forskningen. Ämnesexperter hjälpte till att styra arbetet mot frågor som var relevanta inom fälten. Skillnaden är viktig: beräkningskontroller kan visa om en uträkning klarar angivna tester, medan vetenskapligt omdöme behövs för att välja vad som ska beräknas och tolka resultatet.
5
Vad BootLoops kan – och inte kan – visa
BootLoops erbjuder ett sätt att strukturera AI-assisterat forskningsarbete kring testbara uppgifter, oberoende kontroller och mänsklig expertis. De rapporterade resultaten visar möjligheterna med arbetssättet, men ska inte läsas som en garanti för att alla svar är korrekta eller som ett skäl att hoppa över fortsatt granskning. En kontrollerad beräkning räcker inte i sig som underlag för ett beslut med stora konsekvenser: frågan, antagandena och följderna behöver fortfarande bedömas av människor.
2
4
5