Die Forschung, durchgeführt von Sydney Sears und Dr. Deena Skolnick Weisberg von der Villanova University, testete über 2.500 Erwachsene im Alter von 18 bis 81 Jahren, die über die Plattform Prolific rekrutiert wurden. Verwendet wurden drei originale Kurzgeschichten von veröffentlichten Autoren sowie drei entsprechende, von ChatGPT generierte Geschichten, die in Genre und Erzählelementen aufeinander abgestimmt waren .
Die Studie war in drei Teile gegliedert, die jeweils unterschiedliche Aspekte der Leserwahrnehmung isolieren sollten:
Studie 1 (1.682 Teilnehmende): Jede Person las eine einzige Geschichte und erfuhr – korrekt oder inkorrekt –, ob sie von einem Menschen oder einer KI geschrieben wurde. Anschließend bewerteten sie die Qualität und das narrative Eintauchen .
Studie 2 (424 Teilnehmende): Die Teilnehmenden lasen eine menschliche und eine KI-generierte Geschichte, ohne zu wissen, welche welche war. Anschließend mussten sie den Autor jeder Geschichte erraten .
Studie 3 (481 Teilnehmende): Ein ähnliches Blindlese-Design, bei dem die Teilnehmenden wiederum identifizieren mussten, ob jede Geschichte von einem Menschen oder von ChatGPT stammte .
Die Resultate waren über alle Experimente hinweg bemerkenswert konsistent:
Erkennungsversagen. In Studie 2 lag die korrekte Identifikation bei nur 39,93 % – schlechter als der Zufall. In Studie 3 betrug sie 51,97 %, was statistisch nicht vom Zufall zu unterscheiden war .
KI-Geschichten besser bewertet. In allen Studien erhielten KI-generierte Geschichten höhere Bewertungen sowohl in Bezug auf Qualität als auch darauf, wie sehr sie die Leser fesselten .
Ein ‚Pro-Mensch‘-Zuschreibungsbias. Die am höchsten bewerteten Geschichten waren diejenigen, von denen die Teilnehmenden erfuhren, sie seien von Menschen geschrieben – selbst wenn sie tatsächlich von der KI stammten . Die Forscher argumentieren, dass dies eine tiefsitzende Voreingenommenheit gegenüber Erzählungen offenbart, die als authentisch menschlich wahrgenommen werden .
KI-Kompetenz hilft; literarische Expertise nicht. Jeder Punkt Anstieg in der selbst eingeschätzten KI-Expertise war mit einem 14%igen Anstieg der Wahrscheinlichkeit einer korrekten Identifikation verbunden. Jeder Punkt auf einer validierten KI-Kompetenzskala (AILS) entsprach einem 33%igen Anstieg der Erkennungswahrscheinlichkeit .
Dr. Weisberg erklärte, warum KI-Texte bei diesen Messgrößen offenbar besser abschneiden können: KI-generierte Texte seien „tendenziell klarer, direkter und leichter zu verarbeiten