Menée par Sydney Sears et le Dr Deena Skolnick Weisberg de l'Université Villanova, aux États-Unis, la recherche a testé plus de 2 500 adultes âgés de 18 à 81 ans, recrutés via la plateforme Prolific. Le protocole a utilisé trois nouvelles originales écrites par des auteurs publiés et trois histoires correspondantes générées par ChatGPT, toutes appariées par genre et éléments narratifs .
L'étude s'est déroulée en trois parties, chacune conçue pour isoler un aspect différent de la perception des lecteurs :
Étude 1 (1 682 participants) : chaque personne lisait une seule histoire et on lui disait — correctement ou non — si elle avait été écrite par un humain ou par une IA. Les participants attribuaient ensuite une note de qualité et d'absorption narrative .
Étude 2 (424 participants) : les participants lisaient une histoire écrite par un humain et une autre générée par l'IA, sans savoir laquelle était laquelle. Ils devaient ensuite deviner l'auteur de chaque texte .
Étude 3 (481 participants) : un dispositif similaire de lecture en aveugle, où il fallait à nouveau identifier si chaque histoire venait d'un humain ou de ChatGPT .
Les résultats sont frappants et cohérents d'un bout à l'autre de l'expérience :
Échec de la détection. Dans l'étude 2, le taux d'identification correcte n'était que de 39,93 % — pire qu'un tirage au sort. Dans l'étude 3, il atteignait 51,97 %, soit un résultat statistiquement équivalent au hasard .
Les histoires générées par IA mieux notées. Dans toutes les études, les textes produits par l'IA ont reçu de meilleures notes, tant pour la qualité que pour le caractère absorbant du récit .
Un « biais pro-humain » bien ancré. Les histoires les mieux notées étaient celles dont on disait aux participants qu'elles avaient été écrites par un humain — même lorsqu'elles venaient en réalité de ChatGPT . Les chercheurs y voient la preuve d'un préjugé tenace en faveur des récits perçus comme authentiquement humains .
La connaissance de l'IA aide ; l'expertise littéraire, non. Chaque point supplémentaire dans le niveau d'expertise autodéclaré en IA était associé à une augmentation de 14 % des chances d'identification correcte. Chaque point sur une échelle validée de « littératie en IA » (AILS) correspondait à une hausse de 33 % des chances de détection .
Le Dr Weisberg explique pourquoi l'écriture de l'IA peut sembler supérieure sur ces critères : elle « a tendance à être plus claire, plus directe et plus facile à traiter », alors que les récits humains sont « souvent plus subtils et complexes ». Elle ajoute que « les gens préfèrent généralement la prévisibilité, car un matériau difficile ou subtil demande davantage d'effort cognitif » .
Cette étude s'inscrit dans un ensemble croissant de recherches sur la perception des textes générés par IA. La prose de l'IA évite l'ambiguïté, suit des structures narratives prévisibles et propose des dénouements efficaces — autant de qualités qui rendent la lecture fluide et agréable. La fiction humaine, en revanche, cultive souvent la complexité, la subtilité et les tensions non résolues, ce qui peut sembler moins satisfaisant à court terme, même si l'œuvre est artistiquement plus riche .
Le « biais pro-humain » mis au jour est particulièrement révélateur. Les lecteurs pénalisent les histoires qu'ils croient écrites par une IA, même lorsque le contenu est identique à celui qu'ils ont encensé sous une étiquette « humaine ». Ce biais d'attribution crée un paradoxe : un étudiant qui déclare ouvertement avoir eu recours à l'IA pourrait subir une pénalité de crédibilité, même si son travail est de haute qualité, tandis que celui qui cache son utilisation de l'IA bénéficierait de la préférence du lecteur pour une paternité perçue comme humaine .
Les résultats de l'étude posent des défis fondamentaux aux universités et à leurs politiques d'intégrité académique :
La détection n'est pas fiable. Puisque même des lecteurs entraînés sont incapables de distinguer de façon fiable l'écriture humaine de celle de l'IA, les outils traditionnels de détection du plagiat et le seul jugement des enseignants ne suffisent plus à repérer les travaux rédigés par une IA .
La formation à l'IA est le meilleur rempart. L'étude montre qu'une familiarité avec les systèmes d'IA améliore la capacité de détection, suggérant que les universités devraient investir dans la formation à la littératie en IA pour les étudiants comme pour le corps enseignant, plutôt que de se reposer uniquement sur des mesures répressives .
Il faut repenser la conception des évaluations. Si l'IA peut produire des textes que les lecteurs jugent égaux ou supérieurs au travail humain, les dissertations à la maison et les devoirs d'écriture standard ne sont plus des mesures valides des compétences individuelles des étudiants. Les universités doivent revoir ce qu'elles évaluent réellement et comment .
Les politiques d'intégrité académique doivent évoluer. L'étude suggère qu'une approche plus nuancée est nécessaire — une approche qui définisse les usages acceptables et inacceptables de l'IA, mette l'accent sur le processus et la réflexion plutôt que sur le produit fini, et intègre la littératie en IA dans les programmes .
Le Dr Weisberg insiste : ces résultats ne rendent pas les auteurs humains obsolètes. « Les humains écrivent comme une forme d'expression créative de soi, pour se challenger ou pour donner un sens à leurs expériences. Le fait que l'IA puisse générer des histoires qui ressemblent à des histoires humaines ne change rien à tout cela » .