Forskningen, udført af Sydney Sears og Dr. Deena Skolnick Weisberg fra Villanova University i USA, testede over 2.500 voksne i alderen 18 til 81 år, rekrutteret via forskningsplatformen Prolific. Forskerne brugte tre originale noveller skrevet af anerkendte, udgivne forfattere og tre tilsvarende historier genereret af ChatGPT, alle matchet for genre og narrative elementer .
Studiet var struktureret i tre dele, hver designet til at isolere forskellige aspekter af læsernes opfattelse:
Studie 1 (1.682 deltagere): Hver person læste én enkelt historie og fik at vide – enten korrekt eller forkert – om den var skrevet af et menneske eller af AI. Derefter vurderede de historiens kvalitet og hvor godt de blev opslugt af den .
Studie 2 (424 deltagere): Deltagerne læste én menneskeskreven og én AI-genereret historie uden at få at vide, hvilken var hvilken. Herefter skulle de gætte, hvem der havde skrevet hver historie .
Studie 3 (481 deltagere): Et lignende blindt læseeksperiment, hvor deltagerne igen skulle identificere, om hver historie kom fra et menneske eller fra ChatGPT .
Resultaterne var slående og konsekvente på tværs af eksperimenterne:
Fejl i identifikation. I Studie 2 var den korrekte identifikation kun 39,93 % – værre end et rent gæt. I Studie 3 var den 51,97 %, hvilket statistisk set ikke adskiller sig fra tilfældigheder .
AI-historier fik højere karakterer. På tværs af alle studier fik AI-genererede historier højere vurderinger for både kvalitet og hvor opslugende de var .
En 'pro-menneskelig' tilskrivningsbias. De højest vurderede historier var dem, som deltagerne fik at vide var skrevet af mennesker – selv når de i virkeligheden var AI-genererede . Forskerne argumenterer for, at dette afslører en dybtliggende bias mod narrativer, der opfattes som autentisk menneskelige .
AI-forståelse hjælper; litterær ekspertise gør ikke. Hver stigning på ét point i selvrapporteret AI-ekspertise var forbundet med 14 % højere sandsynlighed for korrekt identifikation. Hvert point på en valideret AI-forståelsesskala (AILS) svarede til 33 % højere sandsynlighed for at spotte AI-teksten .
Dr. Weisberg forklarede, hvorfor AI-tekster kan fremstå bedre på disse parametre: AI-skrivning ”tenderer til at være klarere, mere direkte og lettere at bearbejde”, mens menneskeskrevne historier ”ofte er mere subtile og komplekse”. Hun tilføjede, at ”folk generelt foretrækker forudsigelighed, fordi svært eller subtilt materiale kræver mere hjernekraft” .
Studiet bygger på en voksende mængde af evidens for, hvordan AI-genereret tekst opfattes. AI-skrevet prosa undgår tvetydighed, følgere forudsigelige narrative strukturer og leverer afklaring effektivt – alle kvaliteter, der gør læsning til en ubesværet oplevelse. Menneskelig fiktion omfavner derimod ofte kompleksitet, subtilitet og uløste spændinger, hvilket kan føles mindre umiddelbart tilfredsstillende, selv når det kunstnerisk set er rigere .
Den 'pro-menneskelige' bias, som studiet afslørede, er særligt afslørende. Læsere gav lavere karakterer til historier, de troede var AI-skrevet, selv når indholdet var identisk med historier, de roste under et 'menneskeligt' mærkat. Denne tilskrivningsbias skaber et paradoks: studerende, der åbent oplyser om brug af AI, kan risikere at blive mødt med en troværdighedsbøde, selv når deres arbejde er af høj kvalitet, mens de, der skjuler AI-brug, kan drage fordel af læsernes præference for opfattet menneskeligt forfatterskab .
Studiets resultater udfordrer fundamentalt universiteterne og deres politikker for akademisk integritet:
Detektion er upålidelig. Da selv trænede læsere præsterer på niveau med tilfældigheder, når de skal skelne AI fra menneskelig skrivning, kan traditionelle plagiatdetektionsværktøjer og underviseres egen dømmekraft alene ikke pålideligt identificere AI-forfattede opgaver .
AI-forståelse er den mest effektive modforanstaltning. Studiet viste, at fortrolighed med AI-systemer forbedrede evnen til at opdage dem, hvilket antyder, at universiteter bør investere i træning i AI-forståelse for både studerende og undervisere frem for udelukkende at satse på kontrol og straf .
Eksamensformerne skal gentænkes. Hvis AI kan producere skriftligt arbejde, som læsere vurderer som lige så godt eller bedre end menneskers, er hjemmeopgaver og standard skriveopgaver ikke længere valide mål for den enkelte studerendes kunnen. Universiteterne må overveje, hvilke færdigheder de reelt vurderer, og hvordan .
Akademiske integritetspolitikker skal udvikles. Studiet antyder, at der er brug for en mere nuanceret tilgang – en der definerer acceptabel versus uacceptabel AI-brug, lægger vægt på proces og refleksion frem for slutprodukt, og integrerer AI-forståelse i pensum .
Dr. Weisberg understregede, at resultaterne ikke gør menneskelige forfattere overflødige: ”Mennesker skriver som en form for kreativt selvudtryk eller for at udfordre os selv, eller for at skabe mening i vores oplevelser. At AI kan generere menneskelignende historier, ændrer ikke på noget af det” .