Een AI die op één buik-CT naar veel verschillende afwijkingen kijkt, kan voor een radioloog nuttiger zijn dan een verzameling systemen die elk maar één ziekte herkennen. Dat is de gedachte achter DAMO RADAR, ontwikkeld door Alibaba’s onderzoeksafdeling DAMO Academy met klinische partners. Over het onderzoek is gepubliceerd in Science; het model is bedoeld voor contrastversterkte CT-scans, waarbij contrastmiddel structuren in de buik beter zichtbaar maakt. In de beschreven evaluatie gaat het om 146 bevindingen in 18 organen en anatomische structuren. Dat zijn niet noodzakelijk 146 afzonderlijke diagnoses.
4
8
12
Hoe leert het model zo breed te kijken?
DAMO RADAR is een beeld-taalmodel: het leert verbanden tussen CT-beelden en de medische verslagen die bij die scans zijn opgesteld. Daarmee kan het informatie uit bestaande beschrijvingen benutten, zonder voor iedere aandoening opnieuw een aparte verzameling handmatig ingetekende ziektelabels te vereisen. De beschikbare bronnen beschrijven niet gedetailleerd genoeg hoe alle stappen van die training zijn uitgevoerd, of welke niet-onderzochte aandoeningen het model betrouwbaar zou herkennen.
5
16
Wat zeggen de testresultaten?
Bij bijna 40.000 onderzoeken uit de praktijk bedroeg de gerapporteerde gemiddelde AUC over de 146 onderzochte bevindingen 0,913. AUC geeft aan hoe goed een model positieve en negatieve gevallen van elkaar onderscheidt bij verschillende afkapwaarden. Het cijfer betekent dus niet dat 91,3% van de diagnoses juist was.
14
15
In een afzonderlijke vergelijking met 26 radiologen presteerde RADAR volgens de berichtgeving beter dan 23 van hen op de gebruikte onderzoeksmaat. Wanneer radiologen hulp van het model kregen, werden ongeveer 10% minder bevindingen gemist en nam hun leestijd met ongeveer 30% af. De beschikbare resultaten maken niet duidelijk wat hun gevoeligheid precies vóór en mét AI was, of de genoemde 10% een relatieve daling dan wel een verschil in procentpunten is.
1
6
14
Voor prestaties op scans van andere ziekenhuizen of patiëntengroepen bieden de beschikbare gegevens onvoldoende houvast om een betrouwbaar cijfer of een algemene conclusie te geven.
Open beschikbaar, maar geen zelfstandige diagnose
DAMO Academy heeft de vrijgave van RADAR aangekondigd; volgens berichtgeving zijn ook de modelgewichten beschikbaar. Dat maakt onderzoek en verdere toetsing mogelijk, maar bewijst op zichzelf niet dat het systeem overal veilig inzetbaar is. De meest voor de hand liggende rol is die van tweede lezer of screeningshulp voor een radioloog, niet die van autonome diagnosticus. Toepassing in de zorg vraagt om validatie voor de patiënten en werkwijze waarvoor het model wordt gebruikt.
3
4
7