喺回顧性模擬測試中,MIRA嘅整體診斷準確率係87.8%,而獲得專科資格嘅醫生係78.1%。特別係某啲診斷,例如胰臟炎(95.2%對78.6%)同闌尾炎(100%對88%),差距仲更加明顯。MIRA開嘅血液檢查比醫生多(51%對28%),但另一方面就少開咗好多影像檢查
。呢個系統可以執行超過85,000個臨床動作,同時仲接受咗880個刻意設計嚟呃AI嘅對抗性提示測試,結果冇出現資料外洩
。
數字好靚,但兩個系統都要面對同一個現實:佢哋仲未喺真實病人同真實診症環境入面測試過。模擬同現實之間嘅差距,係專家評論醫療AI代理時最常提到嘅主題。
一篇喺PMC發表嘅全面性範圍回顧報告,直接點出主要挑戰:「缺乏喺真實世界環境入面嘅穩健臨床驗證。」 好多評估都用理想化、合成嘅數據集,而唔係真實病歷記錄嗰種稀疏、唔平衡、成日有缺失值嘅情況。呢篇報告總結話,呢啲系統嘅真實臨床效用,到目前為止仍然冇前瞻性研究可以確認
。
其他主要限制仲包括:
得文字同結構化數據。 無論AMIE定MIRA,主要都係靠文字同結構化數據運作。兩者都做唔到身體檢查——摸肚、聽心跳、睇病人點行路。呢個唔係小問題;身體檢查對於好多診斷仍然係必不可少。
唔會持續學習。 2026年AI Index Report嘅醫學章節分析確認,冇一個系統展示出持續學習或者跨唔同病人嘅長期記憶能力。
用演員,唔係真病人。 AMIE嘅跨門診疾病管理研究雖然嚴謹,但係用專業演員去做虛擬OSCE式嘅會診。MIRA嘅評估就用回顧性病例,AI代理同模擬病人行為嘅AI對話,而唔係同真實病人互動。
安全漏洞。 同一份AI Index分析仲指出,幻覺、決策唔透明、代理之間協調失敗,同容易受到電子病歷系統攻擊,都係自主醫療AI嘅開放安全風險。
更廣泛嘅醫療AI代理研究仲指出幾個持續關注點:
過度依賴風險。 就算係開發咗有防護版本AMIE(叫g-AMIE)嘅研究人員,都承認需要明確限制。g-AMIE嘅設計係要做問診,同時避免提供個人化醫療建議——呢個係明確承認,冇限制嘅自主使用係唔成熟同有潛在危險嘅。
無論AMIE定MIRA,都未準備好做常規臨床應用。AMIE已經行咗一步,同Beth Israel Deaconess Medical Center合作做咗一項前瞻性、單組可行性研究,探討AMIE喺基層醫療門診前點樣幫手收集病人資訊。另外仲有一項同100位病人做嘅緊急護理可行性研究,評估AMIE嘅診前問診,發現佢嘅鑑別診斷包含最終診斷嘅比率係90%,頭三個最準確診斷嘅準確率係75%——不過基層醫生喺管理計劃嘅實用性同成本效益方面仍然好過AMIE
。
呢啲係令人鼓舞嘅初步訊號,但只係可行性研究——唔係可以證明改善病人結果嘅隨機對照試驗。醫療AI代理呢個領域要真正落地,仲有幾個未解決嘅挑戰:
2026年6月嘅呢啲研究代表咗真正嘅進步。AMIE已經由單次診症對話,進化到跨門診疾病管理,仲有指引做基礎嘅推理。MIRA就展示咗一個自主代理可以喺電子病歷系統入面操作,喺小心控制嘅回顧性模擬入面,開檢查同治療嘅水平同醫生睇齊甚至更好。
下一個關鍵里程碑會係喺真實病人身上做前瞻性研究、有清晰嘅監管框架、喺多元化人群中證明安全性,同埋有證據顯示呢啲系統可以改善結果,而唔係只係喺測試場景中同醫生表現睇齊。喺呢個之前,AMIE同MIRA都只係令人印象深刻嘅研究原型——唔係取代人類醫生嘅工具,而係潛在嘅未來輔助工具,需要更多驗證先適合放喺任何診所入面。