Het onderzoek, uitgevoerd door Sydney Sears en dr. Deena Skolnick Weisberg van de Villanova University, testte meer dan 2.500 volwassenen tussen de 18 en 81 jaar, geworven via het onderzoeksplatform Prolific. Er werden drie originele korte verhalen van gepubliceerde menselijke auteurs gebruikt, naast drie overeenkomstige verhalen gegenereerd door ChatGPT, allemaal matched op genre en verhaalelementen .
De studie bestond uit drie delen, elk ontworpen om verschillende aspecten van leeservaring en perceptie te isoleren:
Studie 1 (1.682 deelnemers): Elke persoon las één verhaal en kreeg – juist of onjuist – te horen of het door een mens of AI was geschreven. Vervolgens beoordeelden ze de kwaliteit en de mate van onderdompeling .
Studie 2 (424 deelnemers): Deelnemers lazen een menselijk en een AI-verhaal zonder te weten welk welk was. Daarna moesten ze raden wie de auteur van elk verhaal was .
Studie 3 (481 deelnemers): Een vergelijkbare blinde opzet, waarbij deelnemers opnieuw moesten bepalen of een verhaal door een mens of door ChatGPT was geschreven .
De resultaten waren opvallend en consistent:
Detectie faalt. In studie 2 was het percentage correcte identificatie slechts 39,93% – slechter dan willekeurig raden. In studie 3 was dat 51,97%, statistisch niet afwijkend van kansniveau .
AI-verhalen scoren hoger. In alle studies kregen AI-verhalen hogere beoordelingen voor zowel kwaliteit als onderdompeling .
Een 'pro-menselijke' attributiebias. De hoogst gewaardeerde verhalen waren die waarvan deelnemers dachten dat ze door een mens waren geschreven – zelfs als ze daadwerkelijk door AI waren gegenereerd . De onderzoekers stellen dat dit een diepgewortelde vooringenomenheid onthult voor verhalen die als authentiek menselijk worden ervaren .
AI-kennis helpt; literaire expertise niet. Elke punt stijging in zelfgerapporteerde AI-expertise verhoogde de kans op correcte identificatie met 14%. Elk punt op een gevalideerde AI-geletterdheidsschaal (AILS) leidde tot een 33% hogere detectiekans .
Dr. Weisberg verklaarde waarom AI-schrijven op deze punten beter kan presteren dan mensenwerk: AI-teksten zijn "doorgaans duidelijker, directer en makkelijker te verwerken", terwijl door mensen geschreven verhalen "vaak subtieler en complexer" zijn. Ze voegde eraan toe dat "mensen over het algemeen de voorkeur geven aan voorspelbaarheid, omdat moeilijke of subtiele stof meer denkwerk vereist" .
Het onderzoek bouwt voort op een groeiende hoeveelheid bewijs over hoe AI gegenereerde tekst wordt waargenomen. AI-proza vermijdt dubbelzinnigheid, volgt voorspelbare verhaalstructuren en biedt efficiënte oplossingen – allemaal eigenschappen die het lezen moeiteloos maken. Menselijke fictie daarentegen omarmt vaak complexiteit, subtiliteit en onopgeloste spanning, wat minder direct bevredigend kan aanvoelen, zelfs als het artistiek rijker is .
De 'pro-menselijke' bias die uit het onderzoek naar voren komt, is bijzonder onthullend. Lezers gaven lagere cijfers aan verhalen waarvan ze dachten dat ze door AI waren geschreven, zelfs als de inhoud volledig gelijk was aan verhalen die ze onder een 'menselijk' label prezen. Deze attributiebias kan leiden tot een paradox: studenten die transparant zijn over hun AI-gebruik krijgen mogelijk een geloofwaardigheidsstraf, ook al is hun werk van hoge kwaliteit, terwijl degenen die AI-gebruik verbergen kunnen profiteren van de voorkeur voor vermeend menselijk auteurschap .
De bevindingen van de studie vormen een fundamentele uitdaging voor universiteiten en hun beleid rond academische integriteit:
Detectie is onbetrouwbaar. Aangezien zelfs getrainde lezers niet beter presteren dan kansniveau bij het onderscheiden van AI en menselijk schrijven, kunnen traditionele plagiaatdetectietools en het oordeel van docenten alleen niet langer betrouwbaar AI-auteurschap identificeren .
AI-geletterdheid is de beste tegenmaatregel. De studie toonde aan dat vertrouwdheid met AI-systemen de detectie verbeterde. Dit suggereert dat scholen beter kunnen investeren in AI-geletterdheidstraining voor zowel studenten als docenten, in plaats van alleen te vertrouwen op handhaving .
Toetsontwerp moet op de schop. Als AI in staat is teksten te produceren die lezers als gelijkwaardig of beter beoordelen dan mensenwerk, dan zijn thuistentamens en standaard schrijfopdrachten mogelijk geen valide maatstaven meer voor individuele studentvaardigheden. Universiteiten moeten heroverwegen welke vaardigheden ze werkelijk toetsen en hoe .
Beleid voor academische integriteit moet evolueren. De studie suggereert dat een genuanceerdere aanpak nodig is – een die acceptabel versus onacceptabel AI-gebruik definieert, de nadruk legt op proces en reflectie in plaats van eindproduct, en AI-geletterdheid in het curriculum integreert .
Dr. Weisberg benadrukte dat de bevindingen menselijke auteurs niet overbodig maken: "Mensen schrijven als een vorm van creatieve zelfexpressie, om onszelf uit te dagen of om onze ervaringen te begrijpen. Het feit dat AI menselijke verhalen kan genereren, verandert daar niets aan" .