Ein kontrastverstärktes CT des Bauchraums enthält Hinweise auf viele mögliche Erkrankungen. DAMO RADAR soll solche Aufnahmen mit einem einzigen Bild-Sprach-Modell auf ein breites Spektrum von Auffälligkeiten prüfen, statt für jede Erkrankung ein separates KI-System einzusetzen. Entwickelt wurde es von Alibabas Forschungseinheit DAMO Academy mit klinischen Partnern; die zugehörige Forschung erschien in Science. Untersucht wurde die Erkennung von 146 Befunden in 18 Organen – darunter auch bösartige Tumoren.
3
4
12
Wie lernt das Modell mehrere Befunde zugleich?
Dem berichteten Trainingsansatz zufolge werden CT-Bilder mit den zugehörigen klinischen Befundberichten verknüpft. So kann das Modell Zusammenhänge zwischen Bildinhalt und medizinischen Beschreibungen lernen, ohne für jede einzelne Erkrankung einen neuen Satz manuell eingezeichneter Markierungen zu benötigen. Wie genau das Verfahren umgesetzt wurde und welche zusätzlichen, zuvor nicht geprüften Befunde es zuverlässig erkennt, geht aus den verfügbaren Angaben jedoch nicht eindeutig hervor.
5
16
Was zeigen die Tests?
In knapp 40.000 Untersuchungen aus der klinischen Praxis erreichte RADAR über die 146 geprüften Befunde hinweg eine mittlere AUC von 0,913. Die AUC beschreibt, wie gut ein Modell Fälle mit und ohne einen Befund über verschiedene Entscheidungsschwellen hinweg auseinanderhält. Sie bedeutet nicht, dass 91,3 Prozent aller Diagnosen richtig waren.
14
15
In einem Vergleich mit 26 Radiologen schnitt RADAR nach den vorliegenden Berichten besser ab als 23 von ihnen. Wenn Ärztinnen und Ärzte das Modell als Hilfe nutzten, sank die Zahl übersehener Befunde um etwa 10 Prozent und die Lesezeit um etwa 30 Prozent. Die verfügbaren Angaben nennen aber keine klar nachvollziehbaren Ausgangs- und Endwerte für die Sensitivität. Auch bleibt offen, ob sich die 10 Prozent auf eine relative Veränderung oder auf Prozentpunkte beziehen.
1
6
Eine wichtige Grenze: Für die Leistung außerhalb der untersuchten Daten – etwa bei Scans aus anderen Kliniken oder von anderen Patientengruppen – lässt sich anhand der verfügbaren Ergebnisse keine belastbare Kennzahl angeben. Die gemeldeten Studienwerte sollten deshalb nicht als Garantie für jeden klinischen Einsatz verstanden werden.
DAMO Academy hat die offene Bereitstellung angekündigt; Berichten zufolge sind auch die Modellgewichte verfügbar. Denkbar ist RADAR damit vor allem als zweite Sicht auf einen Befund oder als Unterstützung beim Screening. Eine eigenständige Diagnose oder die notwendige Prüfung vor einem konkreten klinischen Einsatz ersetzt das Modell nicht.
3
4
7