Badanie przeprowadzone przez Sydney Sears i dr Deenę Skolnick Weisberg z Villanova University objęło ponad 2500 dorosłych w wieku od 18 do 81 lat, zrekrutowanych za pośrednictwem platformy Prolific. Wykorzystano w nim trzy oryginalne opowiadania autorstwa publikowanych pisarzy oraz trzy odpowiadające im historie wygenerowane przez ChatGPT – wszystkie dopasowane pod względem gatunku i elementów narracji .
Eksperyment podzielono na trzy części, z których każda miała na celu wyizolowanie innego aspektu percepcji czytelników:
Badanie 1 (1682 uczestników): Każda osoba przeczytała jedno opowiadanie i poinformowano ją – prawidłowo lub nie – czy napisał je człowiek, czy AI. Następnie oceniano jego jakość i wciągnięcie w lekturę .
Badanie 2 (424 uczestników): Uczestnicy czytali jedno opowiadanie napisane przez człowieka i jedno wygenerowane przez AI, nie wiedząc, które jest które. Musieli odgadnąć autora każdego z nich .
Badanie 3 (481 uczestników): Podobna ślepa próba, ponownie wymagająca od uczestników wskazania, czy opowiadanie wyszło spod ręki człowieka, czy ChatGPT .
Wyniki były uderzające i spójne we wszystkich eksperymentach:
Brak zdolności wykrywania. W badaniu 2 poprawne wskazanie wyniosło zaledwie 39,93% – gorzej niż losowe zgadywanie. W badaniu 3 było to 51,97%, czyli statystycznie nie różniło się od przypadku .
Wyższe oceny dla AI. We wszystkich badaniach opowiadania wygenerowane przez sztuczną inteligencję otrzymywały wyższe noty zarówno za jakość, jak i za to, jak bardzo wciągały czytelnika .
Błąd atrybucji „pro-ludzki”. Najwyżej oceniane były te historie, co do których uczestnicy myśleli, że napisał je człowiek – nawet jeśli w rzeczywistości były dziełem AI . Naukowcy argumentują, że ujawnia to głęboko zakorzenione uprzedzenie wobec narracji postrzeganych jako autentycznie ludzkie .
Znajomość AI pomaga; wiedza literacka – nie. Każdy dodatkowy punkt w samodzielnie deklarowanej znajomości AI wiązał się ze wzrostem szans na poprawne wskazanie autora o 14%. Każdy punkt w zwalidowanej skali umiejętności cyfrowych (AILS) odpowiadał zaś wzrostowi o 33% .
Dr Weisberg wyjaśniła, dlaczego pisanie AI może wypadać lepiej w tych testach: „Teksty AI są zazwyczaj bardziej przejrzyste, bezpośrednie i łatwiejsze w odbiorze”, podczas gdy opowiadania pisane przez ludzi „często są bardziej subtelne i złożone”. Dodała, że „ludzie generalnie wolą przewidywalność, ponieważ trudne lub subtelne materiały wymagają więcej pracy umysłowej” .
Badanie opiera się na rosnącej liczbie dowodów na to, jak odbierany jest tekst generowany przez AI. Proza autorstwa sztucznej inteligencji unika niejednoznaczności, podąża za przewidywalnymi strukturami narracyjnymi i sprawnie dostarcza rozwiązań – to wszystko sprawia, że czytanie staje się łatwe i przyjemne. Ludzka fikcja natomiast często sięga po złożoność, subtelność i nierozwiązane napięcia, które mogą być mniej satysfakcjonujące na pierwszy rzut oka, nawet jeśli są artystycznie bogatsze .
Szczególnie odkrywczy jest błąd atrybucji „pro-ludzki” ujawniony w badaniu. Czytelnicy obniżali oceny opowiadań, które – jak im powiedziano – zostały napisane przez AI, nawet jeśli treść była identyczna z historiami chwalonymi pod etykietą „ludzką”. Ten błąd atrybucji tworzy paradoks: studenci, którzy otwarcie informują o użyciu AI, mogą spotkać się z karą za wiarygodność, nawet jeśli ich praca jest wysokiej jakości, podczas gdy ci, którzy ukrywają użycie AI, mogą korzystać z preferencji czytelników dla postrzeganego ludzkiego autorstwa .
Wnioski z badania stanowią fundamentalne wyzwanie dla uniwersytetów i ich polityk dotyczących uczciwości akademickiej:
Wykrywanie jest zawodne. Skoro nawet wyćwiczeni czytelnicy radzą sobie na poziomie przypadku przy odróżnianiu AI od człowieka, tradycyjne narzędzia antyplagiatowe i sam osąd wykładowcy nie są w stanie wiarygodnie zidentyfikować prac napisanych przez AI .
Znajomość AI to najskuteczniejsza przeciwwaga. Badanie wykazało, że znajomość systemów AI poprawia zdolność wykrywania, co sugeruje, że uniwersytety powinny inwestować w szkolenia z umiejętności cyfrowych dla studentów i wykładowców, zamiast polegać wyłącznie na egzekwowaniu przepisów .
Projektowanie ocen wymaga przemyślenia. Jeśli AI potrafi tworzyć teksty, które czytelnicy oceniają jako równe lub lepsze od prac ludzkich, prace domowe w formie wypracowań i standardowe zadania pisemne mogą przestać być ważnymi miarami indywidualnych umiejętności studenta. Uniwersytety muszą zastanowić się, jakie umiejętności faktycznie oceniają i jak .
Zasady uczciwości akademickiej muszą ewoluować. Badanie sugeruje, że potrzebne jest bardziej zniuansowane podejście – takie, które określa dopuszczalne i niedopuszczalne użycie AI, kładzie nacisk na proces i refleksję, a nie tylko na końcowy produkt, oraz włącza umiejętności cyfrowe do programów nauczania .
Dr Weisberg podkreśliła, że wyniki nie oznaczają, iż ludzcy autorzy stali się zbędni: „Ludzie piszą jako forma twórczej ekspresji, aby rzucić sobie wyzwanie lub zrozumieć swoje doświadczenia. Fakt, że AI potrafi tworzyć opowiadania podobne do ludzkich, niczego w tym nie zmienia” .