Дослідження, проведене Сідні Сірз (Sydney Sears) та докторкою Діною Скольнік Вайсберг (Deena Skolnick Weisberg) з Університету Вілланова (Villanova University), охопило понад 2500 дорослих віком від 18 до 81 року, набраних через платформу Prolific. Для експерименту використали три оригінальні короткі оповідання, написані опублікованими авторами, і три відповідні оповідання, згенеровані ChatGPT в аналогічному жанрі .
Дослідження складалося з трьох частин, кожна з яких мала на меті виокремити різні аспекти читацького сприйняття:
Дослідження 1 (1682 учасники): Кожен учасник читав одне оповідання. Йому повідомляли — правильно чи ні — чи написане воно людиною, чи ШІ. Потім учасники оцінювали якість оповідання та рівень занурення в нього .
Дослідження 2 (424 учасники): Учасники читали одне оповідання, написане людиною, та одне, згенероване ШІ, без жодних підказок про авторство. Після цього вони мали вгадати, хто написав кожне з них .
Дослідження 3 (481 учасник): Повторення дизайну «наосліп» із вимогою визначити, чи кожне з оповідань створила людина чи ChatGPT .
Результати були вражаючими та послідовними в усіх експериментах:
Нездатність виявити автора. У Дослідженні 2 правильне визначення становило лише 39,93% — гірше, ніж випадкове вгадування. У Дослідженні 3 цей показник сягнув 51,97%, що статистично не відрізняється від випадковості .
ШІ-тексти оцінені вище. В усіх дослідженнях оповідання, згенеровані ШІ, отримували вищі оцінки як за якістю, так і за ступенем захопливості .
«Пролюдський» зсув в атрибуції. Найвищі оцінки отримували оповідання, які учасникам сказали, що написані людьми — навіть якщо насправді вони були згенеровані ШІ . Дослідники стверджують, що це викриває глибоко вкорінену упередженість на користь наративів, які сприймаються як автентично людські .
Грамотність у сфері ШІ допомагає; літературний досвід — ні. Кожне збільшення на один пункт у самооцінці експертності в ШІ асоціювалося зі зростанням ймовірності правильного визначення на 14%. Кожен пункт за валідованою шкалою AI Literacy Scale (AILS) відповідав збільшенню шансів виявлення на 33% .
Докторка Вайсберг пояснила, чому ШІ-тексти можуть вигравати за цими показниками: ШІ «пише зрозуміліше, пряміше і легше для сприйняття», тоді як людські тексти «часто є більш тонкими та складними». Вона додала, що «люди загалом віддають перевагу передбачуваності, оскільки складний або неоднозначний матеріал потребує більше розумових зусиль» .
Дослідження спирається на зростаючий масив доказів того, як сприймаються тексти, згенеровані ШІ. ШІ-проза, як правило, уникає двозначності, слідує передбачуваним наративним структурам і ефективно пропонує розв'язку — усі ці якості роблять читання легким. Натомість людська література часто використовує складність, тонкі нюанси та нерозв'язану напругу, що може здаватися менш негайно задовільним, навіть якщо з художньої точки зору це багатший текст .
Особливо показовим є «пролюдський» зсув, виявлений у дослідженні. Читачі знижували оцінки оповіданням, які, на їхню думку, були написані ШІ, навіть коли зміст був ідентичним текстам, які вони хвалили під «людською» позначкою. Цей зсув атрибуції створює парадокс: студенти, які відкрито повідомляють про використання ШІ, можуть зіткнутися зі штрафом за довірою, навіть якщо їхня робота високоякісна, тоді як ті, хто приховує використання ШІ, можуть отримати вигоду від читацької переваги сприйнятого людського авторства .
Результати дослідження ставлять фундаментальні виклики перед університетами та їхньою політикою академічної доброчесності:
Виявлення є ненадійним. Оскільки навіть досвідчені читачі демонструють результати, близькі до випадкових, при розрізненні людського та ШІ-письма, традиційні інструменти перевірки на плагіат та судження викладачів не можуть надійно ідентифікувати роботи, створені ШІ .
AI-грамотність — найефективніша протидія. Дослідження виявило, що знайомство з системами ШІ покращує здатність до виявлення, що свідчить про необхідність для університетів інвестувати в навчання AI-грамотності як для студентів, так і для викладачів, а не покладатися лише на заборонні заходи .
Дизайн оцінювання потребує переосмислення. Якщо ШІ може створювати тексти, які читачі оцінюють як рівноцінні або кращі за людські, то домашні есе та стандартні письмові завдання можуть більше не бути валідними показниками індивідуальних здібностей студента. Університети повинні переглянути, які саме навички вони насправді оцінюють і яким чином .
Політика академічної доброчесності має еволюціонувати. Дослідження свідчить про необхідність більш нюансованого підходу — такого, що визначає прийнятне та неприйнятне використання ШІ, наголошує на процесі та рефлексії, а не на кінцевому продукті, та інтегрує AI-грамотність у навчальні програми .
Докторка Вайсберг наголосила, що ці висновки не роблять людських авторів зайвими: «Люди пишуть як форму творчого самовираження, щоб кинути виклик собі або осмислити власний досвід. Те, що ШІ може створювати схожі на людські історії, цього не змінює» .