Обычно медицинский ИИ решает узкую задачу — например, ищет один тип опухоли. DAMO RADAR задуман иначе: одна визуально-языковая модель анализирует КТ брюшной полости с контрастированием на широкий круг заболеваний и других изменений. В опубликованной оценке проверялись 146 клинических находок в 18 органах, включая злокачественные опухоли. Разработку исследовательского подразделения Alibaba, DAMO Academy, вели совместно с клиническими партнёрами; результаты представлены в журнале Science.
3
4
12
Откуда модель получает знания
При обучении сопоставляли КТ-изображения с относящимися к ним медицинскими заключениями. В этих текстах врачи уже описали увиденное, поэтому такой подход позволяет использовать существующие данные, а не готовить с нуля отдельную ручную разметку для каждого состояния. Это объясняет, как модель может выйти за рамки детектора одной болезни. Однако доступные описания не дают возможности в полной мере проверить технические детали обучения или утверждать, что RADAR надёжно распознаёт любую новую, ранее не проверенную находку.
5
16
Что означают цифры испытаний
При проверке на почти 40 000 реальных обследований средняя площадь под ROC-кривой — AUC — составила 0,913 по 146 находкам. AUC показывает, насколько хорошо оценки модели отделяют случаи с находкой от случаев без неё при разных порогах принятия решения. Это не означает, что диагноз верен в 91,3% случаев.
14
15
В отдельном сравнении с 26 рентгенологами RADAR показала результат выше, чем 23 участника, по использованному в исследовании показателю. Когда врачи работали с помощью модели, число пропущенных находок, согласно сообщениям об исследовании, снизилось примерно на 10%, а время чтения — примерно на 30%. Из доступных данных при этом нельзя надёжно восстановить исходные и итоговые значения чувствительности врачей или определить, означает ли снижение пропусков на 10% относительное изменение либо изменение в процентных пунктах.
1
6
14
Важное ограничение: имеющихся сведений недостаточно, чтобы назвать надёжный показатель работы RADAR вне условий обучающих данных — например, на исследованиях из других больниц или популяций. Поэтому результаты испытаний не стоит автоматически переносить на любую клинику.
DAMO Academy объявила об открытом выпуске модели; сообщения также указывают на доступность её весов. Это даёт исследователям и медицинским организациям возможность изучать систему, но само по себе не подтверждает её пригодность для применения без дополнительных проверок. Наиболее осторожный сценарий использования — помощник рентгенолога, который подсказывает, где стоит внимательнее проверить возможную находку, а не ставит диагноз вместо врача.
3
4
6
7