BootLoops 1.0 è un toolkit open source che aiuta i modelli linguistici a svolgere calcoli scientifici precisi seguendo procedure di verifica. Lo ha sviluppato il fisico di Harvard Matthew Schwartz con Claude, ma il sistema non è legato a un solo modello: il suo obiettivo è rendere controllabili risultati specifici, non garantire che ogni risposta dell’IA sia corretta.
11
2
Come vengono controllati i calcoli
BootLoops riunisce strumenti software scientifici e protocolli che definiscono quali verifiche deve superare un risultato. Tra queste, il confronto con un metodo di calcolo indipendente e controlli su casi che non sono stati usati per adattare il risultato. È previsto anche un controllo positivo, per dimostrare che la procedura riesce a individuare un esito sbagliato. Le indicazioni tengono inoltre traccia della provenienza dei risultati: uno strumento usato per ottenere una risposta non dovrebbe essere l’unico a certificarla.
2
11
Questo approccio è adatto a problemi con un risultato ben definito, come alcuni calcoli di fisica matematica. Può fornire elementi per stabilire se un risultato supera determinati test; non dimostra che ogni affermazione generata da un modello sia corretta, né che la domanda di ricerca sia rilevante.
2
5
I risultati ottenuti con Claude
Il gruppo di Schwartz ha riferito di aver calcolato 30 integrali di fisica matematica. Quindici risultati sono stati descritti come nuovi, tra cui integrali ellittici di Feynman. Il lavoro comprende anche una soluzione a quello che Schwartz definisce il «problema finale» di Watson, un calcolo legato alle ricerche del matematico George Watson.
14
16
4
Nel complesso, l’attività è stata descritta come un percorso di tre mesi che ha prodotto 36 manoscritti con 19 coautori in 18 campi, tra cui ecologia e genetica delle popolazioni. Si tratta di risultati di ricerca riportati, non della conferma che ogni risultato abbia già superato una verifica indipendente: Schwartz ha detto che alcuni erano ancora in fase di controllo.
3
15
4
Perché il giudizio degli esperti conta ancora
Schwartz usa l’espressione «disadattamento d’impedenza» per descrivere la distanza tra ciò di cui gli scienziati hanno bisogno e ciò che gli attuali modelli linguistici sanno fare meglio. L’IA può essere utile quando il compito è circoscritto, il problema è definito e i controlli sono espliciti. Ma la ricerca richiede anche di capire quali domande meritino attenzione e che cosa significhi davvero un risultato.
1
5
Nel racconto di Schwartz, Claude ha individuato collegamenti tra discipline diverse che potevano essere corretti sul piano tecnico, ma non necessariamente interessanti dal punto di vista scientifico. Gli esperti dei singoli campi hanno aiutato a orientare il lavoro verso questioni rilevanti per quelle discipline. La distinzione è cruciale: i controlli computazionali possono indicare se un calcolo supera determinate prove; il giudizio scientifico aiuta a decidere che cosa calcolare e come interpretare il risultato.
5
Che cosa dimostra BootLoops, e che cosa no
BootLoops propone un modo per organizzare la ricerca assistita dall’IA attorno a compiti verificabili, controlli indipendenti e competenze umane. I risultati riferiti mostrano il potenziale di questo approccio, ma non vanno intesi come una garanzia generale di correttezza né come un sostituto di ulteriori verifiche. Un calcolo controllato, da solo, non basta a giustificare una decisione ad alto impatto: anche la domanda, le ipotesi di partenza e le possibili conseguenze richiedono l’esame di una persona esperta.
2
4
5