Tutkimuksen toteuttivat Sydney Sears ja tohtori Deena Skolnick Weisberg Villanovan yliopistosta. Siihen osallistui yli 2 500 aikuista iältään 18–81 vuotta, jotka rekrytoitiin Prolific-palvelun kautta. Tutkimuksessa käytettiin kolmea julkaistujen ihmiskirjailijoiden alkuperäistä novellia ja kolmea ChatGPT:n tuottamaa tarinaa, jotka oli sovitettu vastaamaan lajityypiltään ja kerronnallisilta elementeiltään ihmisten kirjoittamia .
Tutkimus oli jaettu kolmeen osaan, joista jokainen oli suunniteltu eristämään eri puolia lukijoiden havainnoinnista:
Tutkimus 1 (1 682 osallistujaa): Jokainen luki yhden tarinan ja sai tiedon – joko oikean tai virheellisen – siitä, oliko se ihmisen vai AI:n kirjoittama. Osallistujat arvioivat tarinan laatua ja kerronnallista uppoutumista .
Tutkimus 2 (424 osallistujaa): Osallistujat lukivat yhden ihmisen ja yhden AI:n kirjoittaman tarinan ilman tietoa siitä, kumpi on kumpi, ja heidän piti arvata kummankin kirjoittaja .
Tutkimus 3 (481 osallistujaa): Vastaava sokean lukemisen asetelma, jossa osallistujien piti tunnistaa, oliko tarina ihmisen vai ChatGPT:n kirjoittama .
Tulokset olivat silmiinpistäviä ja johdonmukaisia kaikissa kokeissa:
Tunnistaminen epäonnistuu. Tutkimuksessa 2 oikea tunnistaminen oli vain 39,93 % – huonompi kuin sattumanvarainen arvaus. Tutkimuksessa 3 luku oli 51,97 %, mikä ei poikennut tilastollisesti sattumasta .
AI:n tarinat saivat korkeammat arvosanat. Kaikissa tutkimuksissa tekoälyn tuottamat tarinat saivat korkeammat arvosanat sekä laadusta että siitä, kuinka uppouttaviksi ne koettiin .
'Ihmisen tekemä -vinouma'. Korkeimmat arvosanat saivat tarinat, joiden osallistujille kerrottiin olevan ihmisen kirjoittamia – vaikka ne todellisuudessa olivat tekoälyn tuottamia . Tutkijoiden mukaan tämä paljastaa syvälle juurtuneen vinouman tarinoita kohtaan, jotka koetaan aidosti ihmisen tekemiksi .
Tekoälylukutaito auttaa; kirjallisuuden asiantuntemus ei. Jokainen itsearvioidun tekoälyasiantuntemuksen lisäyspiste lisäsi oikean tunnistamisen todennäköisyyttä 14 prosentilla. Jokainen piste validoidulla tekoälylukutaidon asteikolla (AILS) vastasi 33 prosentin lisäystä tunnistamisen todennäköisyydessä .
Tohtori Weisberg huomautti, miksi tekoälyn kirjoittama teksti saattaa vaikuttaa ihmisen työtä paremmalta näissä mittareissa: AI-kirjoittaminen "on yleensä selkeämpää, suorempaa ja helpommin käsiteltävää", kun taas ihmisten kirjoittamat tarinat ovat "usein hienovaraisempia ja monimutkaisempia". Hän lisäsi, että "ihmiset yleensä suosivat ennustettavuutta, koska vaikea tai hienovarainen aineisto vaatii enemmän aivokapasiteettia" .
Tutkimus perustuu kasvavaan näyttöön siitä, miten tekoälyn tuottamaa tekstiä havainnoidaan. AI:n kirjoittama proosa pyrkii välttämään monitulkintaisuutta, noudattaa ennustettavia kerronnan rakenteita ja tarjoaa ratkaisuja tehokkaasti – kaikki ominaisuuksia, jotka tekevät lukemisesta vaivatonta. Ihmisten kirjoittama fiktio puolestaan usein suosii monimutkaisuutta, hienovaraisuutta ja ratkaisematonta jännitettä, mikä voi tuntua vähemmän välittömästi tyydyttävältä, vaikka se olisi taiteellisesti rikkaampaa .
Tutkimuksessa paljastunut ihmisen tekemän suosimisen vinouma on erityisen paljastava. Lukijat rankaisivat tarinoita, joiden uskoivat olevan AI:n kirjoittamia, vaikka sisältö oli identtistä sen kanssa, jota he kehuivat 'ihmisen tekemä' -tarralla. Tämä vinouma luo paradoksin: opiskelijat, jotka läpinäkyvästi ilmoittavat käyttävänsä tekoälyä, saattavat kohdata uskottavuusvähennyksen, vaikka heidän työnsä olisi laadukasta, kun taas ne, jotka piilottavat AI:n käytön, voivat hyötyä lukijoiden mieltymyksestä koettuun ihmisen tekijyyteen .
Tutkimuksen löydökset asettavat perustavanlaatuisia haasteita yliopistoille ja niiden akateemisen rehellisyyden käytännöille:
Tunnistaminen on epäluotettavaa. Koska jopa koulutetut lukijat suoriutuvat sattumanvaraisella tasolla erottaessaan AI:n ja ihmisen kirjoittamaa tekstiä, perinteiset plagiaatintunnistustyökalut ja opettajien oma harkinta eivät yksinään kykene luotettavasti tunnistamaan AI:n kirjoittamia tehtäviä .
Tekoälylukutaito on tehokkain vastakeino. Tutkimus osoitti, että tekoälyjärjestelmien tuntemus paransi tunnistamiskykyä, mikä viittaa siihen, että yliopistojen tulisi panostaa tekoälylukutaidon koulutukseen sekä opiskelijoille että henkilökunnalle sen sijaan, että ne luottaisivat pelkästään valvontaan ja sanktioihin .
Arviointitapoja on mietittävä uudelleen. Jos tekoäly pystyy tuottamaan tekstiä, jota lukijat pitävät yhtä hyvänä tai parempana kuin ihmisen työtä, perinteiset kotitehtävät ja tavalliset kirjoitustehtävät eivät enää välttämättä ole päteviä yksilöllisen osaamisen mittareita. Yliopistojen on pohdittava uudelleen, mitä taitoja ne todella arvioivat ja miten .
Akateemisen rehellisyyden käytäntöjä on kehitettävä. Tutkimus viittaa siihen, että tarvitaan vivahteikkaampi lähestymistapa, joka määrittelee hyväksyttävän ja ei-hyväksyttävän AI-käytön, korostaa prosessia ja pohdintaa lopputuloksen sijaan ja integroi tekoälylukutaidon opetussuunnitelmiin .
Tohtori Weisberg korosti, että löydökset eivät tee ihmiskirjailijoista tarpeettomia: "Ihmiset kirjoittavat luovan itsensä ilmaisun muotona tai haastaakseen itsensä tai tehdäkseen kokemuksistaan ymmärrettäviä. Se, että tekoäly pystyy tuottamaan ihmisen kaltaisia tarinoita, ei muuta sitä millään tavalla" .