מה שמייחד את DAMO RADAR אינו הבטחה לאבחן לבדו מחלה מסוימת, אלא ניסיון לרכז בדיקה של ממצאים רבים במודל אחד. המערכת, שפיתחה DAMO Academy של עליבאבא עם שותפים קליניים ושמחקר עליה פורסם ב־Science, מיועדת לניתוח סריקות CT של הבטן לאחר הזרקת חומר ניגוד. היא נבחנה על 146 ממצאים קליניים ב־18 איברים ומבנים אנטומיים, ובהם גם ממצאים הקשורים לגידולים ממאירים. המספר מתייחס לממצאים שנבדקו — לא להבטחה שכל מחלה תזוהה בוודאות.
12
3
8
איך מודל אחד בודק ממצאים רבים?
RADAR הוא מודל ראייה־שפה: לפי הדיווחים, הוא לומד את הקשר בין תמונות ה־CT לבין הדוחות הקליניים שנכתבו בעקבותיהן. כך אפשר להיעזר במידע שכבר מצוי בדוחות, במקום לבנות לכל מצב רפואי מאגר חדש של סימונים ידניים ומודל ייעודי משלו. המקורות הזמינים אינם מפרטים דיים כיצד בדיוק יושמה שיטת האימון, ואין להסיק ממנה שהמודל יזהה באופן אמין כל מצב חדש שלא נבדק.
5
16
מה הראו הבדיקות?
בהערכה שהתבססה על כמעט 40,000 בדיקות מהעולם האמיתי, דווח על AUC ממוצע של 0.913 לאורך 146 הממצאים. AUC מודד עד כמה תחזיות המודל מבחינות בין מקרים חיוביים לשליליים על פני ספי החלטה שונים; הוא אינו אומר ש־91.3% מהאבחנות היו נכונות.
14
15
במחקר השוואתי עם 26 רדיולוגים, דווח שהמודל השיג תוצאה טובה מזו של 23 מהם במדד ההשוואה שנבדק. כאשר הרופאים נעזרו בו, מספר הממצאים שהוחמצו ירד בכ־10%, וזמן הקריאה התקצר בכ־30%. מן המידע הזמין לא ניתן לקבוע מה היו ערכי הרגישות המדויקים של הרופאים לפני הסיוע ואחריו, או אם הירידה של 10% היא יחסית או נמדדת בנקודות אחוז.
1
6
14
ומה לגבי סריקות שונות מאלה שעליהן אומן? במקורות הזמינים אין די נתונים כדי למסור מדד מהימן לביצועי המודל בבתי חולים, באוכלוסיות או בתנאי בדיקה שונים. זו מגבלה חשובה לפני הסקת מסקנות על שימוש רחב. DAMO Academy הודיעה על פרסום המודל בקוד פתוח, ולפי הדיווחים גם משקלי המודל זמינים. לעת עתה, התפקיד הקליני הסביר שלו הוא כלי עזר או קורא שני לרדיולוג — לא אבחון אוטונומי ולא תחליף לאימות קליני במקום שבו מבקשים להשתמש בו.
3
4
7