La investigación, dirigida por Sydney Sears y la Dra. Deena Skolnick Weisberg de la Universidad de Villanova, evaluó a más de 2500 adultos de entre 18 y 81 años reclutados a través de Prolific. Se utilizaron tres relatos cortos originales escritos por autores humanos publicados y tres relatos correspondientes generados por ChatGPT, todos equiparados en género y elementos narrativos .
El estudio se estructuró en tres partes, cada una diseñada para aislar diferentes aspectos de la percepción del lector:
Estudio 1 (1682 participantes): Cada persona leyó un único relato y se le informó, correcta o incorrectamente, si estaba escrito por un humano o por IA. Luego lo valoraron en cuanto a calidad y absorción narrativa .
Estudio 2 (424 participantes): Leían un relato escrito por humanos y otro generado por IA sin que se les dijera cuál era cuál. Luego tenían que adivinar el autor de cada uno .
Estudio 3 (481 participantes): Un diseño similar de lectura a ciegas, que nuevamente requería que los participantes identificaran si cada relato provenía de un humano o de ChatGPT .
Los resultados fueron sorprendentes y consistentes en todos los experimentos:
Fallo en la detección. En el Estudio 2, la identificación correcta fue solo del 39.93 %, peor que el azar. En el Estudio 3, fue del 51.97 %, estadísticamente indistinguible del azar .
Los relatos de IA obtuvieron mejores puntuaciones. En todos los estudios, los relatos generados por IA recibieron puntuaciones más altas tanto en calidad como en lo absorbentes que resultaban .
Un sesgo de atribución 'pro-humano'. Los relatos mejor valorados fueron aquellos que los participantes creían escritos por humanos, incluso cuando en realidad eran generados por IA . Los investigadores sostienen que esto revela un sesgo profundamente arraigado hacia las narrativas percibidas como auténticamente humanas .
La alfabetización en IA ayuda; la experiencia literaria, no. Cada aumento de un punto en la experiencia autodeclarada en IA se asoció con un aumento del 14 % en las probabilidades de identificación correcta. Cada punto en una Escala de Alfabetización en IA (AILS) validada correspondió a un aumento del 33 % en las probabilidades de detección .
La Dra. Weisberg señaló por qué la escritura de IA puede parecer superior al trabajo humano en estas métricas: la escritura de IA "tiende a ser más clara, más directa y más fácil de procesar", mientras que las historias escritas por humanos son "a menudo más sutiles y complejas". Añadió que "la gente generalmente prefiere la previsibilidad, porque el material difícil o sutil requiere más esfuerzo cerebral" .
El estudio se suma a un creciente cuerpo de evidencia sobre cómo se percibe el texto generado por IA. La prosa de la IA tiende a evitar la ambigüedad, sigue estructuras narrativas predecibles y ofrece resoluciones de manera eficiente, todas cualidades que hacen que la lectura se sienta sin esfuerzo. La ficción humana, por el contrario, a menudo abraza la complejidad, la sutileza y la tensión no resuelta, lo que puede resultar menos satisfactorio de inmediato, incluso cuando es artísticamente más rica .
El sesgo 'pro-humano' descubierto en el estudio es particularmente revelador. Los lectores penalizaron las historias que creían escritas por IA, incluso cuando el contenido era idéntico al de las historias que elogiaban bajo la etiqueta de 'humano'. Este sesgo de atribución crea una paradoja: los estudiantes que revelan de forma transparente el uso de IA podrían enfrentarse a una penalización de credibilidad incluso cuando su trabajo es de alta calidad, mientras que aquellos que ocultan el uso de IA podrían beneficiarse de la preferencia de los lectores por la autoría humana percibida .
Los hallazgos del estudio plantean desafíos fundamentales para las universidades y sus políticas de integridad académica:
La detección no es fiable. Dado que incluso los lectores entrenados rinden cerca del azar al distinguir la escritura de IA de la humana, las herramientas tradicionales de detección de plagio y el criterio del instructor por sí solos no pueden identificar de forma fiable los trabajos creados por IA .
La alfabetización en IA es la contramedida más eficaz. El estudio encontró que la familiaridad con los sistemas de IA mejoraba la capacidad de detección, lo que sugiere que las universidades deberían invertir en formación en alfabetización en IA tanto para estudiantes como para profesores, en lugar de depender únicamente de medidas punitivas .
El diseño de las evaluaciones necesita replantearse. Si la IA puede producir textos que los lectores juzgan como iguales o superiores al trabajo humano, los ensayos para casa y las tareas de escritura estándar pueden dejar de ser medidas válidas de la capacidad individual del estudiante. Las universidades deben reconsiderar qué habilidades están evaluando realmente y cómo hacerlo .
Las políticas de integridad académica deben evolucionar. El estudio sugiere que se necesita un enfoque más matizado, uno que defina el uso aceptable e inaceptable de la IA, enfatice el proceso y la reflexión por encima del producto final, e incorpore la alfabetización en IA en los planes de estudio .
La Dra. Weisberg insistió en que los hallazgos no hacen obsoletos a los autores humanos: "Los humanos escriben como una forma de autoexpresión creativa, para desafiarnos a nosotros mismos o para dar sentido a nuestras experiencias. El hecho de que la IA pueda generar historias similares a las humanas no cambia nada de eso" .