У реальному проєкті з клінічними дослідженнями автоматизоване вилучення даних із PDF за допомогою ШІ забезпечило прискорення у 500 разів порівняно з ручним вилученням, а також точніші результати та значне зменшення ручної праці . Для цього навчали доменно-специфічну попередньо натреновану мовну модель розпізнавати 20 релевантних сутностей (наприклад, назва препарату, дати початку та завершення випробування)
.
Відновлення структури таблиць — головна слабкість. Тестування на 200 реальних документах показало, що базові парсери PDF отримують 0.000 балів за відновлення структури таблиць — текст витягується, але зв'язки між рядками та стовпцями втрачаються . Складні макети, скановані PDF без належного текстового шару та багатоколонкові документи спричиняють найбільше помилок. Без контексту розташування LLM можуть «галюцинувати» значення або припускатися пропусків, неправильної класифікації та фактичних помилок
.
Інші постійні виклики — жорсткість методів, заснованих на правилах, та брак анотованих доменно-специфічних наборів даних для навчання підходів на основі машинного навчання .
Кілька ШІ-інструментів уже орієнтовані на робочий процес систематичних оглядів та мета-аналізу:
ШІ може витягувати дані, методологію та результати з PDF-досліджень із корисною точністю та трансформаційною швидкістю. Але він ще недостатньо надійний, щоб повністю замінити людську перевірку для критичних застосувань, таких як регуляторні подання або фінальні таблиці даних систематичних оглядів — особливо коли йдеться про таблиці та складні макети. Рекомендованою практикою для відповідальних випадків залишається верифікація даних, отриманих за допомогою ШІ, людиною .