В традиционном бенчмарке вопрос, входные данные и ожидаемый ответ обычно определены заранее. TRACES начинает с практической научной цели, которую ещё нужно превратить в выполнимую исследовательскую задачу. Затем решатель взаимодействует со средой, совершает действия, запускает научные или вычислительные инструменты и получает обратную связь, похожую на результаты эксперимента или проверку верификатора.
Процесс выглядит как более длинный цикл:
Поэтому бенчмарк фиксирует траекторию исследования, а не только сходство финального текста с эталонным ответом. Такой формат особенно полезен для вопросов, на которые пока нет общепринятого решения и, следовательно, обычной «правильной» метки для автоматической проверки.
Название TRACES складывается из шести измерений проверки процесса, которые также описываются как HDS6:
В совокупности эти критерии должны помочь отличить надёжное исследование от уверенной, но ничем не подкреплённой догадки. Они также дают возможность оценивать качество работы даже тогда, когда окончательный ответ пока невозможно подтвердить напрямую.
В основе Apodex Discovery лежит идея о том, что для оценки открытого научного поиска нужны как минимум корректно сформулированная проблема, реалистичная среда, механизмы проверки и циклы, позволяющие системе исправлять собственные ошибки. TRACES — практическая реализация этого подхода.
Для поиска задач Apodex, по собственным данным, изучила 561 отрасль в 16 секторах и собрала 423 приоритетные задачи из реального мира. В первый выпуск бенчмарка вошли 20 задач.
В опубликованных материалах упоминаются, среди прочего, следующие направления:
Эти примеры показывают заявленный охват проекта, однако доступные материалы не дают полного публичного перечня всех задач и отраслей, представленных в релизе.
AI-системы всё чаще рассматриваются как инструменты для выдвижения гипотез, выбора направлений исследований, анализа результатов экспериментов и проектирования итеративных рабочих процессов. В таких сценариях одной беглой и убедительной формулировки недостаточно. Система должна понимать, что именно проверять, интерпретировать полученный результат, восстанавливаться после ошибок и не заявлять больше, чем позволяют данные.
TRACES закрывает именно этот пробел, рассматривая научное исследование как интерактивный процесс. Решатель, который приходит к полезному результату через проверяемые доказательства и обоснованные исправления, существенно отличается от системы, случайно выдавшей похожий вывод без надёжного пути к нему.
При этом такой бенчмарк не отменяет человеческий контроль. Исследователям и профильным экспертам по-прежнему предстоит задавать цели и ограничения, оценивать этические и практические риски, проверять исходные предположения и доказательства, а также решать, оправдывает ли вывод переход к реальным действиям. Акцент TRACES на проверяемой траектории и ограниченных утверждениях ценен именно тем, что даёт экспертам больше материала для анализа, чем изолированное финальное заявление.
В публичном объявлении Apodex говорится об открытом наборе заявок как для систем-решателей, так и для научных задач.
Заявка на участие в качестве решателя должна представлять полную систему, используемую для исследования, а не только базовую модель. В неё входят оболочка оркестрации, инструменты, память и политика управления действиями.
Предлагаемая научная проблема, в свою очередь, должна быть переводима в исполняемую и проверяемую среду. На практике это означает необходимость описать, что система может наблюдать и делать, какую обратную связь получает и каким образом промежуточные или итоговые выводы будут сопоставляться с заранее определёнными критериями успеха.
TRACES меняет сам вопрос, который задаёт бенчмарк: вместо «дал ли ИИ ожидаемый ответ?» предлагается спросить «провёл ли он дисциплинированное исследование, основанное на доказательствах?». Такой формат лучше соответствует научному поиску, чем статичные тесты с ключом ответов.
Но у подхода есть важная граница. Оценка процесса может сделать проверку ИИ содержательнее, однако сама по себе не доказывает, что найденное системой открытие безопасно, полезно или готово к применению. Окончательное научное суждение и решение о реальных действиях по-прежнему остаются за людьми.