BootLoops 1.0 — открытый инструментарий, который помогает языковым моделям выполнять точные научные расчёты и проверять их по заданным правилам. Его разработал физик Гарварда Мэттью Шварц вместе с Claude. При этом система не привязана к одной модели: её задача — не объявить любой ответ ИИ достоверным, а сделать конкретные результаты поддающимися проверке.
11
2
Как устроена проверка
BootLoops объединяет научные программы и протоколы, которые задают критерии надёжного результата. Например, расчёт предлагают сверять с независимым вычислительным методом на данных, которые не использовались при подборе ответа. Также нужен положительный контроль: тест должен показать, что способен обнаружить ошибку. Отдельные правила касаются происхождения результата — программа, участвовавшая в подгонке ответа, не должна сама же служить независимым подтверждением.
2
11
Такой подход особенно подходит для задач с чётко заданным результатом, например расчётов в математической физике. Он позволяет показать, что ответ прошёл определённые тесты, но не доказывает автоматически правильность любых утверждений модели и не отвечает на вопрос, важно ли само исследование.
2
5
Какие результаты представила команда Шварца
По сообщению команды, с помощью инструментария были рассчитаны 30 интегралов математической физики. Среди них — 15 результатов, представленных как новые, в том числе для эллиптических интегралов Фейнмана. В работе также приведено решение того, что Шварц называет «последней задачей Уотсона»: расчёта, связанного с более ранними работами математика Джорджа Уотсона.
14
16
4
В более широком проекте, по опубликованным данным, за три месяца подготовили 36 рукописей с участием 19 соавторов в 18 областях, включая экологию и популяционную генетику. Это заявленные исследовательские результаты, а не свидетельство того, что каждый из них уже прошёл независимую проверку: Шварц говорил, что несколько результатов ещё проверяются.
3
15
4
Почему экспертная оценка всё ещё важна
Шварц описывает разрыв между возможностями языковых моделей и потребностями науки термином «несогласование импедансов». Модели могут быть полезны в ограниченных вычислительных задачах, где заранее определены и вопрос, и способ проверки. Но научная работа включает и другое: нужно решить, какие вопросы заслуживают внимания, а затем понять, что полученный ответ означает.
1
5
По словам Шварца, Claude находил связи между разными дисциплинами, которые могли быть технически корректными, но не особенно значимыми для самой науки. Эксперты в соответствующих областях помогали направить работу на вопросы, важные именно для этих дисциплин. Здесь проходит ключевая граница: вычислительные тесты помогают проверить расчёт, а научное суждение — выбрать, что считать, и оценить значение результата.
5
Что BootLoops показывает — и чего не гарантирует
BootLoops предлагает организовать работу ИИ вокруг проверяемых задач, независимых тестов и участия специалистов. Представленные результаты показывают потенциал такого подхода, но не дают общей гарантии безошибочности и не отменяют дальнейшей проверки. Даже подтверждённый расчёт сам по себе недостаточен для решения с серьёзными последствиями: людям всё равно нужно оценить исходный вопрос, допущения и возможные последствия.
2
4
5