조영증강 복부 CT를 읽을 때 질환마다 별도의 AI를 돌리는 대신, 하나의 모델로 여러 장기의 이상 소견을 함께 살필 수 있을까. 알리바바의 연구 조직 DAMO 아카데미가 임상 협력 기관과 개발한 DAMO RADAR가 겨냥한 과제다. 연구 결과는 학술지 《Science》에 발표됐으며, 보도에 따르면 이 모델은 18개 장기에 걸친 146개 임상 소견을 평가 대상으로 삼았다. ‘146개 소견’에는 질병뿐 아니라 영상에서 관찰되는 이상도 포함되므로, 이를 ‘146개 질병을 확진한다’는 뜻으로 받아들이면 곤란하다.
4
8
12
질병별 탐지기를 따로 만들지 않는 이유
DAMO RADAR는 CT 영상과 그 검사에 딸린 임상 판독 보고서를 연결해 학습하는 영상·언어 모델이다. 기존 보고서에 담긴 의학적 설명을 학습 자료로 활용해, 질환마다 새로 수작업 표지를 만들어야 하는 방식에 덜 의존한다는 것이 핵심이다. 다만 제공된 자료만으로는 영상과 문장을 연결한 세부 학습 절차나, 학습 범위 밖의 새로운 질환을 어디까지 안정적으로 알아보는지 확인하기 어렵다.
5
16
숫자는 어떻게 읽어야 하나
약 4만 건의 실제 검사를 대상으로 한 평가에서, 146개 소견에 대한 평균 AUC는 0.913으로 보고됐다. AUC는 판정 기준을 달리했을 때 양성 사례와 음성 사례를 얼마나 잘 구별하는지 나타내는 지표다. 따라서 이 수치를 ‘환자 100명 중 91.3명을 정확히 진단했다’는 의미로 바꿔 말할 수는 없다.
14
15
영상의학과 의사 26명이 참여한 비교에서는 모델이 23명보다 높은 성적을 냈다는 보도가 나왔다. 의사가 AI의 도움을 받아 판독했을 때는 놓친 소견이 약 10%, 판독 시간이 약 30% 줄었다고 전해진다. 하지만 제공된 결과에는 도움을 받기 전후의 민감도 수치가 명확히 제시되지 않았고, ‘10%’가 상대적 감소인지 10%포인트 감소인지도 확인하기 어렵다.
1
6
14
공개 모델이 곧바로 임상 도구가 되는 것은 아니다
DAMO 아카데미는 모델의 오픈소스 공개를 발표했고, 모델 가중치도 제공된다는 보도가 있다. 연구자와 의료기관이 검토할 수 있는 길이 열린 셈이지만, 공개 여부와 실제 진료 현장에서의 안전성 검증은 별개다. 특히 제공된 자료만으로는 학습·평가 환경과 다른 병원이나 환자 집단에서의 성능을 신뢰할 만한 수치로 설명할 수 없다.
3
4
7
현재 결과가 가리키는 현실적인 쓰임새는 의사의 판단을 대신하는 자동 진단이 아니라, 판독 중 놓칠 수 있는 소견을 다시 짚어주는 보조 도구다. 실제 사용 범위는 적용할 의료 환경에서 별도로 성능을 확인한 뒤 판단해야 한다.