A pesquisa, conduzida por Sydney Sears e pela Dra. Deena Skolnick Weisberg, da Universidade Villanova (EUA), testou mais de 2.500 adultos entre 18 e 81 anos recrutados pela plataforma Prolific. Foram usados três contos originais escritos por autores humanos publicados e três histórias correspondentes geradas pelo ChatGPT, todas pareadas por gênero e elementos narrativos .
O experimento foi estruturado em três partes, cada uma desenhada para isolar diferentes aspectos da percepção dos leitores:
Estudo 1 (1.682 participantes): Cada pessoa leu uma única história e foi informada — correta ou incorretamente — se ela havia sido escrita por um humano ou por IA. Em seguida, avaliaram a qualidade e o nível de imersão (absorção narrativa) .
Estudo 2 (424 participantes): Os participantes leram uma história humana e uma gerada por IA, sem saber qual era qual. Depois, tiveram que adivinhar o autor de cada uma .
Estudo 3 (481 participantes): Um desenho de leitura cega similar, novamente exigindo que os participantes identificassem se cada história vinha de um humano ou do ChatGPT .
Os resultados foram impressionantes e consistentes entre os experimentos:
Falha na detecção. No Estudo 2, a identificação correta foi de apenas 39,93% — pior do que o acaso. No Estudo 3, foi de 51,97%, estatisticamente igual ao acaso .
Histórias de IA receberam notas mais altas. Em todos os estudos, as histórias geradas por IA receberam avaliações superiores tanto em qualidade quanto em capacidade de absorver o leitor .
Um viés de atribuição 'pró-humano'. As histórias mais bem avaliadas foram aquelas que os participantes foram informados que foram escritas por humanos — mesmo quando, na verdade, eram geradas por IA . Os pesquisadores argumentam que isso revela um viés profundo em favor de narrativas percebidas como autenticamente humanas .
Letramento em IA ajuda; expertise literária, não. Cada ponto adicional em expertise auto-relatada em IA foi associado a um aumento de 14% nas chances de identificação correta. Cada ponto em uma escala validada de Letramento em IA (AILS) correspondeu a um aumento de 33% nas chances de detecção .
A Dra. Weisberg observou por que a escrita da IA pode parecer superior nessas métricas: a escrita da IA "tende a ser mais clara, mais direta e mais fácil de processar", enquanto as histórias humanas são "frequentemente mais sutis e complexas". Ela acrescentou que "as pessoas geralmente preferem a previsibilidade, porque material difícil ou sutil exige mais poder cerebral" .
O estudo se soma a um crescente corpo de evidências sobre como o texto gerado por IA é percebido. A prosa da IA tende a evitar ambiguidades, segue estruturas narrativas previsíveis e entrega resoluções de forma eficiente — todas qualidades que tornam a leitura um esforço quase automático. A ficção humana, por outro lado, frequentemente abraça a complexidade, a sutileza e a tensão não resolvida, o que pode parecer menos satisfatório de imediato, mesmo quando é artisticamente mais rica .
O viés 'pró-humano' descoberto no estudo é particularmente revelador. Os leitores penalizaram as histórias que acreditavam ser escritas por IA, mesmo quando o conteúdo era idêntico ao de histórias que elogiavam sob um rótulo 'humano'. Esse viés de atribuição cria um paradoxo: alunos que divulgam de forma transparente o uso de IA podem enfrentar uma penalidade de credibilidade, mesmo quando seu trabalho é de alta qualidade, enquanto aqueles que escondem o uso de IA podem se beneficiar da preferência dos leitores por uma autoria percebida como humana .
As descobertas do estudo representam desafios fundamentais para as universidades e suas políticas de integridade acadêmica:
A detecção é pouco confiável. Já que mesmo leitores treinados têm desempenho próximo ao acaso ao distinguir IA de escrita humana, as ferramentas tradicionais de detecção de plágio e o julgamento do professor, sozinhos, não conseguem identificar de forma confiável trabalhos feitos por IA .
O letramento em IA é a contramedida mais eficaz. O estudo descobriu que a familiaridade com sistemas de IA melhorou a capacidade de detecção, sugerindo que as universidades devem investir em treinamento de letramento em IA tanto para alunos quanto para professores, em vez de confiar apenas na aplicação de regras .
O design das avaliações precisa ser repensado. Se a IA pode produzir textos que os leitores julgam iguais ou superiores ao trabalho humano, as redações caseiras e as tarefas padrão de escrita podem não ser mais medidas válidas da habilidade individual do aluno. As universidades precisam reconsiderar quais habilidades estão realmente sendo avaliadas e como .
As políticas de integridade acadêmica precisam evoluir. O estudo sugere que é necessária uma abordagem mais matizada — que defina o uso aceitável versus inaceitável de IA, enfatize o processo e a reflexão em vez do produto final, e incorpore o letramento em IA nos currículos .
A Dra. Weisberg ressaltou que as descobertas não tornam os autores humanos obsoletos: "Os humanos escrevem como uma forma de autoexpressão criativa, para nos desafiar ou para dar sentido às nossas experiências. O fato de a IA poder gerar histórias semelhantes às humanas não muda nada disso" .