BootLoops 1.0 busca que los modelos de lenguaje no solo produzcan cálculos convincentes, sino que también puedan someterlos a pruebas. El físico de Harvard Matthew Schwartz desarrolló este kit de código abierto con Claude. Aunque nació de ese trabajo conjunto, la herramienta no depende de un modelo específico: reúne software científico y protocolos para hacer más comprobables ciertos resultados.
11
2
Cómo verifica los cálculos
Los protocolos de BootLoops definen qué debe pasar para considerar que un resultado superó las pruebas. Entre otras medidas, proponen contrastarlo con una vía de cálculo independiente y evaluarlo en puntos que no se usaron para ajustarlo. También piden un control positivo: una prueba que demuestre que el procedimiento puede detectar un resultado incorrecto. Además, contemplan registrar la procedencia de los resultados, para evitar que una herramienta que ayudó a obtenerlos sea también la única que los certifique.
2
11
Este enfoque encaja especialmente bien con problemas cuantitativos de alcance definido, como ciertos cálculos de física matemática. Puede aportar evidencia de que un resultado pasó pruebas específicas, pero no garantiza que cualquier afirmación de un modelo sea correcta ni que la pregunta estudiada sea científicamente importante.
2
5
Los resultados reportados por el equipo
Schwartz informó que el equipo calculó 30 integrales de física matemática. Quince fueron descritas como resultados nuevos; entre ellas había integrales elípticas de Feynman. El trabajo también incluyó una solución a lo que Schwartz llama el «problema final» de Watson, una serie de cálculos relacionada con el matemático George Watson.
14
16
4
El esfuerzo más amplio, desarrollado durante tres meses, dio lugar —según lo reportado— a 36 manuscritos con 19 coautores en 18 campos, entre ellos la ecología y la genética de poblaciones. Son resultados de investigación comunicados por el equipo, no la confirmación de que cada uno haya completado una verificación independiente: Schwartz señaló que varios seguían en revisión.
3
15
4
Por qué siguen haciendo falta especialistas
Schwartz describe como «desajuste de impedancia» la diferencia entre lo que los investigadores necesitan y aquello para lo que los modelos de lenguaje actuales suelen funcionar mejor. Pueden ser útiles en tareas acotadas, con un problema bien definido y criterios explícitos para comprobar la respuesta. Pero la ciencia también exige decidir qué preguntas vale la pena plantear y evaluar si un resultado tiene relevancia.
1
5
Según Schwartz, Claude encontró conexiones entre distintas disciplinas que podían ser técnicamente correctas, pero poco significativas para la ciencia. Los especialistas de cada campo ayudaron a orientar el trabajo hacia preguntas importantes para esas áreas. La distinción es clave: comprobar un cálculo ayuda a saber si pasó determinadas pruebas; el criterio científico permite decidir qué calcular y cómo interpretar el resultado.
5
Una herramienta, no una garantía
BootLoops ofrece una forma de organizar investigaciones asistidas por IA en torno a tareas comprobables, pruebas independientes y orientación experta. Los resultados reportados ilustran el potencial del enfoque, pero no son una garantía general de exactitud ni reemplazan verificaciones adicionales. Y aunque un cálculo haya superado ciertas pruebas, eso por sí solo no basta para justificar una decisión de alto impacto: también hay que examinar la pregunta, los supuestos y las posibles consecuencias.
2
4
5