Forskningen, som genomfördes av Sydney Sears och Dr. Deena Skolnick Weisberg vid Villanova University i USA, testade över 2 500 vuxna i åldrarna 18 till 81 år som rekryterades via plattformen Prolific. Man använde tre originalnoveller skrivna av publicerade mänskliga författare och tre motsvarande berättelser genererade av ChatGPT, alla matchade i genre och narrativa element .
Studien var uppdelad i tre delar, var och en utformad för att isolera olika aspekter av läsarnas uppfattning:
Studie 1 (1 682 deltagare): Varje person läste en enda berättelse och fick veta – antingen korrekt eller felaktigt – om den var skriven av en människa eller AI. De betygsatte sedan berättelsen när det gällde kvalitet och narrativ absorption .
Studie 2 (424 deltagare): Deltagarna läste en mänskligt skriven och en AI-genererad berättelse utan att få veta vilken som var vilken. De fick sedan gissa vem som skrivit varje berättelse .
Studie 3 (481 deltagare): En liknande blindläsningsdesign, där deltagarna återigen skulle identifiera om varje berättelse kom från en människa eller från ChatGPT .
Resultaten var slående och konsekventa över experimenten:
Misslyckad detektion. I studie 2 var den korrekta identifieringen bara 39,93 procent – sämre än slumpen. I studie 3 var den 51,97 procent, vilket statistiskt sett inte skiljer sig från slumpen .
AI-berättelser fick högre betyg. I samtliga studier fick AI-genererade berättelser högre betyg både när det gällde kvalitet och hur fängslande läsarna tyckte att de var .
En 'pro-mänsklig' tillskrivningsbias. De högst rankade berättelserna var de som deltagarna fick höra var skrivna av människor – även när de i själva verket var AI-genererade . Forskarna menar att detta avslöjar en djupt rotad partiskhet för narrativ som uppfattas som autentiskt mänskliga .
AI-kunskap hjälper; litterär expertis gör det inte. Varje ökning med en poäng i självrapporterad AI-expertis var kopplad till en 14-procentig ökning av oddsen för korrekt identifiering. Varje poäng på en validerad AI Literacy Scale (AILS) motsvarade en 33-procentig ökning av detektionsoddsen .
Dr. Weisberg förklarade varför AI-skrivande kan verka överträffa mänskligt arbete på dessa mått: AI-skrivande "tenderar att vara tydligare, mer direkt och lättare att processa", medan mänskligt skrivna berättelser "ofta är mer subtila och komplexa". Hon tillade att "människor i allmänhet föredrar förutsägbarhet, eftersom svårt eller subtilt material kräver mer hjärnkraft" .
Studien bygger på en växande mängd bevis för hur AI-genererad text uppfattas. AI-skriven prosa tenderar att undvika tvetydighet, följa förutsägbara narrativa strukturer och leverera upplösningar effektivt – alla egenskaper som gör läsningen lätt och behaglig. Mänsklig skönlitteratur å sin sida omfamnar ofta komplexitet, subtilitet och olösta spänningar, vilket kan kännas mindre omedelbart tillfredsställande även när den är konstnärligt rikare .
Den 'pro-mänskliga' biasen som avslöjades i studien är särskilt avslöjande. Läsarna bestraffade berättelser som de trodde var AI-skrivna, även när innehållet var identiskt med berättelser som de hyllade under en 'mänsklig' etikett. Denna tillskrivningsbias skapar en paradox: studenter som öppet redovisar AI-användning kan möta en trovärdighetsstraff även när deras arbete håller hög kvalitet, medan de som döljer AI-användning kan dra nytta av läsarnas preferens för upplevt mänskligt författarskap .
Studiens resultat innebär grundläggande utmaningar för universitet och deras policyer för akademisk integritet:
Detektion är opålitlig. Eftersom även tränade läsare presterar nära slumpen när det gäller att skilja AI från mänskligt skrivande, kan traditionella plagiatdetektionsverktyg och lärarnas omdöme ensamt inte på ett tillförlitligt sätt identifiera AI-författade inlämningsuppgifter .
AI-kunskap är det mest effektiva motmedlet. Studien fann att förtrogenhet med AI-system förbättrade detektionsförmågan, vilket tyder på att universitet bör investera i AI-kunskapsträning för både studenter och lärare snarare än att enbart förlita sig på sanktioner .
Bedömningsdesignen måste tänkas om. Om AI kan producera texter som läsare bedömer som lika bra eller bättre än mänskligt arbete, kanske hemuppgifter och standardiserade skrivuppgifter inte längre är giltiga mått på individuell studentförmåga. Universiteten måste ompröva vilka färdigheter de faktiskt bedömer och hur .
Policyer för akademisk integritet måste utvecklas. Studien tyder på att en mer nyanserad strategi behövs – en som definierar acceptabel kontra oacceptabel AI-användning, betonar process och reflektion framför slutprodukt, och integrerar AI-kunskap i läroplanerna .
Dr. Weisberg betonade att resultaten inte gör mänskliga författare överflödiga: "Människor skriver som en form av kreativt självuttryck eller för att utmana oss själva, eller för att skapa mening i våra erfarenheter. Det faktum att AI kan generera männskliga berättelser förändrar inte det" .