BootLoops 1.0 ne promet pas que l’intelligence artificielle a toujours raison. Cet outil open source, créé par le physicien de Harvard Matthew Schwartz avec Claude, vise plutôt à rendre certains calculs scientifiques plus faciles à contrôler. Il associe des logiciels spécialisés à des protocoles de travail, et peut être utilisé avec différents modèles.
11
2
Des résultats soumis à des tests
Pour vérifier un calcul, BootLoops prévoit notamment de le comparer à une méthode de calcul indépendante, sur des points qui n’ont pas servi à l’ajuster. Il demande aussi un « contrôle positif » : autrement dit, un test qui montre que la procédure est capable de repérer un résultat erroné. Des règles de traçabilité visent également à éviter qu’un outil ayant participé à l’obtention d’un résultat soit le seul à le valider.
2
11
Cette approche se prête bien aux tâches dont le résultat peut être défini précisément, comme certains calculs de physique mathématique. Elle peut montrer qu’un résultat a satisfait des tests déterminés ; elle ne garantit pas que toute réponse produite par un modèle est correcte, ni que la question étudiée est importante.
2
5
Des intégrales de physique mathématique aux recherches pluridisciplinaires
L’équipe de Schwartz rapporte avoir calculé 30 intégrales de physique mathématique. Quinze résultats sont présentés comme nouveaux, notamment des intégrales elliptiques de Feynman. Le travail comprend aussi une solution à ce que Schwartz appelle le « problème final » de Watson, en référence au mathématicien George Watson et à ses travaux antérieurs.
14
16
4
À l’échelle du projet, 36 manuscrits auraient été préparés en trois mois avec 19 coauteurs, dans 18 domaines, parmi lesquels l’écologie et la génétique des populations. Ces manuscrits constituent des résultats de recherche rapportés, mais ne signifient pas que chaque résultat a déjà fait l’objet d’une vérification indépendante complète : Schwartz a indiqué que plusieurs étaient encore en cours de vérification.
3
15
4
Pourquoi les experts restent indispensables
Schwartz parle de « décalage d’impédance » pour décrire la difficulté à faire coïncider les capacités des modèles de langage avec les besoins des chercheurs. Les modèles peuvent être utiles pour des tâches circonscrites, surtout lorsque le problème et les tests sont clairement définis. La recherche implique aussi de déterminer quelles questions méritent d’être posées et ce que signifie réellement une réponse.
1
5
Selon Schwartz, Claude a repéré des liens entre disciplines qui pouvaient être techniquement corrects sans être scientifiquement remarquables. Des spécialistes de chaque domaine ont aidé à orienter le travail vers des questions pertinentes pour ces champs. La distinction est essentielle : les tests informatiques peuvent établir si un calcul satisfait des critères précis ; le jugement scientifique aide à décider quoi calculer et comment interpréter le résultat.
5
Un outil de vérification, pas un certificat universel
BootLoops propose une manière d’organiser le travail avec l’IA autour de tâches testables, de contrôles indépendants et de l’expertise humaine. Les résultats rapportés illustrent le potentiel de cette méthode, mais ne constituent ni une garantie générale d’exactitude ni un substitut à des vérifications supplémentaires. Même un calcul contrôlé ne suffit pas, à lui seul, à justifier une décision à fort enjeu : les hypothèses, la question posée et les conséquences doivent aussi être examinées par des personnes.
2
4
5