Forskningen, utført av Sydney Sears og Dr. Deena Skolnick Weisberg ved Villanova University i USA, testet over 2.500 voksne i alderen 18 til 81 år rekruttert via Prolific. Studien brukte tre originale noveller skrevet av publiserte forfattere og tre tilsvarende historier generert av ChatGPT, alle matchet for sjanger og narrative elementer .
Studien var delt inn i tre deler, hver designet for å isolere ulike aspekter ved lesernes oppfatning:
Studie 1 (1.682 deltakere): Hver person leste én enkelt historie og ble fortalt – enten korrekt eller feilaktig – om den var skrevet av et menneske eller AI. Deretter vurderte de kvalitet og hvor engasjerende historien var .
Studie 2 (424 deltakere): Deltakerne leste én menneskeskrevet og én AI-generert historie uten å få vite hvilken som var hvilken. De måtte deretter gjette forfatteren av hver .
Studie 3 (481 deltakere): Et lignende blindtest-design som krevde at deltakerne identifiserte om hver historie kom fra et menneske eller ChatGPT .
Resultatene var slående og konsistente på tvers av eksperimentene:
Deteksjonssvikt. I studie 2 var korrekt identifikasjon bare 39,93 % – dårligere enn tilfeldig gjetning. I studie 3 var det 51,97 %, ikke statistisk forskjellig fra tilfeldighet .
AI-historier vurdert høyere. På tvers av alle studier fikk AI-genererte historier høyere karakterer for både kvalitet og hvor engasjerende leserne fant dem .
En 'pro-menneskelig' attribusjonsskjevhet. Historiene som fikk høyest karakter, var de deltakerne ble fortalt var skrevet av mennesker – selv når de faktisk var AI-generert . Forskerne argumenterer for at dette avslører en dyp forankret skjevhet mot narrativer som oppfattes som autentisk menneskelige .
AI-kompetanse hjelper; litterær erfaring gjør det ikke. Hver økning på ett poeng i selvrapportert AI-ekspertise var forbundet med 14 % økning i sannsynligheten for korrekt identifikasjon. Hvert poeng på en validert AI Literacy-skala (AILS) tilsvarte 33 % økning .
Dr. Weisberg påpekte hvorfor AI-tekster kan se ut til å overgå menneskelig arbeid på disse målingene: AI-tekster har «en tendens til å være klarere, mer direkte og lettere å prosessere», mens menneskeskrevne historier «ofte er mer subtile og komplekse». Hun la til at «folk generelt foretrekker forutsigbarhet, fordi vanskelig eller subtilt materiale krever mer hjernekraft» .
Studien bygger på en voksende mengde bevis for hvordan AI-generert tekst oppfattes. AI-skrevet prosa unngår tvetydighet, følger forutsigbare narrative strukturer og leverer løsninger effektivt – alle egenskaper som gjør lesing til en uanstrengt opplevelse. Menneskeskrevet fiksjon omfavner derimot ofte kompleksitet, subtilitet og uløst spenning, noe som kan føles mindre umiddelbart tilfredsstillende, selv når det er kunstnerisk rikere .
Den 'pro-menneskelige' skjevheten som ble avdekket i studien, er spesielt avslørende. Lesere straffet historier de trodde var AI-skrevet, selv når innholdet var identisk med historier de roste under en 'menneskelig' etikett. Denne attribusjonsskjevheten skaper et paradoks: Studenter som åpent oppgir AI-bruk, kan møte en troverdighetsstraff selv når arbeidet er av høy kvalitet, mens de som skjuler AI-bruk, kan dra nytte av lesernes preferanse for opplevd menneskelig forfatterskap .
Studiens funn utfordrer universiteter og deres retningslinjer for akademisk integritet på flere grunnleggende måter:
Deteksjon er upålitelig. Siden selv trente lesere presterer på nivå med tilfeldighet når de skal skille AI fra menneskelig skriving, kan verken tradisjonelle plagiatverktøy eller læreres vurdering alene pålitelig identifisere AI-skrevet arbeid .
AI-kompetanse er det mest effektive mottiltaket. Studien fant at kjennskap til AI-systemer forbedret deteksjonsevnen, noe som tyder på at universiteter bør investere i AI-kompetanseheving for både studenter og ansatte, heller enn å stole utelukkende på kontrolltiltak .
Vurderingsformer må revurderes. Hvis AI kan produsere tekster som lesere vurderer som like gode eller bedre enn menneskelig arbeid, kan hjemmeeksamener og standard skriveoppgaver ikke lenger være gyldige mål på individuelle studentferdigheter. Universiteter må revurdere hvilke ferdigheter de faktisk måler, og hvordan .
Akademiske integritetsregler må utvikles. Studien antyder at en mer nyansert tilnærming er nødvendig – en som definerer akseptabel versus uakseptabel AI-bruk, vektlegger prosess og refleksjon fremfor sluttprodukt, og integrerer AI-kompetanse i læreplanene .
Dr. Weisberg understreket at funnene ikke gjør menneskelige forfattere overflødige: «Mennesker skriver som en form for kreativt selvuttrykk, for å utfordre oss selv, eller for å skape mening i våre erfaringer. Det at AI kan generere menneskelignende historier forandrer ikke noe av det» .