BootLoops 1.0 — це набір відкритих інструментів, який допомагає мовним моделям виконувати точні наукові обчислення так, щоб результати можна було перевірити. Його розробив фізик Гарвардського університету Метью Шварц за участю Claude. Система не прив’язана до однієї моделі: її задум — не оголосити відповіді ШІ правильними наперед, а зробити конкретні результати придатними до перевірки.
11
2
Як BootLoops перевіряє обчислення
В основі BootLoops — наукове програмне забезпечення та протоколи, що визначають, які перевірки має пройти результат. Зокрема, відповідь порівнюють із незалежним способом обчислення у точках, які не використовувалися для її підгонки. Також застосовують контрольний приклад: він має показати, що перевірка справді здатна виявити хибний результат. Протоколи враховують і походження даних та інструментів — засіб, який допомагав підбирати відповідь, не повинен сам її засвідчувати.
2
11
Такий підхід найкраще пасує до завдань із чітко визначеним результатом, наприклад обчислень у математичній фізиці. Він дає змогу підтвердити, що результат пройшов конкретні тести, але не гарантує правильності кожного твердження, згенерованого моделлю, і не доводить, що саме запитання було науково важливим.
2
5
Які результати команда повідомила за участю Claude
За словами команди Шварца, вона обчислила 30 інтегралів із математичної фізики. Серед них — 15 результатів, описаних як нові, зокрема для еліптичних інтегралів Фейнмана. Робота також охопила розв’язання того, що Шварц називає «останньою задачею Вотсона», — обчислення, пов’язаного з попередніми працями математика Джорджа Вотсона.
14
16
4
Ширший проєкт, за повідомленнями, за три місяці дав 36 наукових рукописів за участю 19 співавторів у 18 галузях, серед яких екологія та популяційна генетика. Важливо розрізняти заявлені результати й завершену незалежну перевірку: Шварц зазначав, що кілька результатів іще перевіряли.
3
15
4
Чому без наукових експертів не обійтися
Шварц називає проблему «неузгодженістю імпедансів» — запозиченим із фізики образом ситуації, коли дві системи працюють, але погано взаємодіють. Моделі можуть бути корисними для обмежених обчислювальних завдань, якщо чітко задано і задачу, і критерії перевірки. Та наукова робота також вимагає визначити, які питання варто ставити, і зрозуміти, що відповідь означає.
1
5
За словами Шварца, Claude знаходив зв’язки між різними галузями, які могли бути технічно правильними, але не обов’язково науково важливими. Фахівці з відповідних дисциплін допомагали спрямувати роботу на питання, що мають значення для цих галузей. У цьому й полягає різниця: обчислювальна перевірка може показати, чи пройшов розрахунок задані тести, а наукове судження — допомогти вирішити, що саме рахувати і як тлумачити результат.
5
Що BootLoops підтверджує — і чого не гарантує
BootLoops дає змогу будувати роботу за участю ШІ навколо завдань, які можна перевірити, незалежних контрольних обчислень і людської експертизи. Повідомлені результати демонструють потенціал такого підходу, але не є загальною гарантією правильності й не скасовують подальшої перевірки. Самого лише успішно перевіреного розрахунку недостатньо, щоб обґрунтувати рішення з високими ставками: людям і далі потрібно оцінювати запитання, припущення та можливі наслідки.
2
4
5