Penyelidikan yang dikendalikan oleh Sydney Sears dan Dr. Deena Skolnick Weisberg dari Universiti Villanova ini menguji lebih 2,500 orang dewasa berumur 18 hingga 81 tahun yang direkrut melalui platform Prolific. Kajian ini menggunakan tiga cerpen asli oleh penulis manusia yang telah diterbitkan dan tiga cerita sepadan yang dihasilkan oleh ChatGPT, semuanya dipadankan dari segi genre dan elemen naratif .
Kajian ini distruktur dalam tiga bahagian, setiap satunya direka untuk mengasingkan aspek persepsi pembaca yang berbeza:
Kajian 1 (1,682 peserta): Setiap orang membaca satu cerita dan diberitahu—sama ada betul atau salah—sama ada ia ditulis oleh manusia atau AI. Mereka kemudian menilai kualiti dan daya penyerapan cerita tersebut .
Kajian 2 (424 peserta): Peserta membaca satu cerita tulisan manusia dan satu cerita hasil AI tanpa diberitahu yang mana satu. Mereka kemudian perlu meneka penulis bagi setiap cerita .
Kajian 3 (481 peserta): Reka bentuk bacaan buta yang sama, sekali lagi memerlukan peserta untuk mengenal pasti sama ada setiap cerita datang daripada manusia atau ChatGPT .
Hasilnya sangat ketara dan konsisten merentas eksperimen:
Kegagalan pengesanan. Dalam Kajian 2, pengenalan yang betul hanyalah 39.93%—lebih teruk daripada kebarangkalian rawak. Dalam Kajian 3, ia adalah 51.97%, secara statistik tiada perbezaan daripada kebarangkalian .
Cerita AI dinilai lebih tinggi. Merentas semua kajian, cerita yang dihasilkan AI menerima penilaian yang lebih tinggi untuk kedua-dua kualiti dan sejauh mana ia menyerap perhatian pembaca .
Bias 'pro-manusia'. Cerita yang mendapat penilaian tertinggi ialah cerita yang diberitahu kepada peserta sebagai ditulis oleh manusia—walaupun ia sebenarnya dihasilkan AI . Para penyelidik berpendapat ini mendedahkan bias yang berakar umbi terhadap naratif yang dianggap sebagai tulen daripada manusia .
Literasi AI membantu; kepakaran sastera tidak. Setiap peningkatan satu mata dalam kepakaran AI yang dilaporkan sendiri dikaitkan dengan peningkatan 14% dalam kebarangkalian pengenalan yang betul. Setiap mata pada Skala Literasi AI (AILS) yang disahkan sepadan dengan peningkatan 33% dalam kebarangkalian pengesanan .
Dr. Weisberg menyatakan mengapa penulisan AI mungkin kelihatan mengatasi kerja manusia pada metrik ini: penulisan AI "cenderung lebih jelas, lebih langsung dan lebih mudah untuk diproses," manakala cerita tulisan manusia "selalunya lebih halus dan kompleks." Beliau menambah bahawa "orang ramai secara amnya lebih suka kebolehramalan, kerana bahan yang sukar atau halus memerlukan lebih banyak daya otak" .
Kajian ini dibina berdasarkan bukti yang semakin meningkat tentang cara teks yang dihasilkan AI dilihat. Prosa tulisan AI cenderung mengelakkan kekaburan, mengikuti struktur naratif yang boleh diramal, dan menyampaikan resolusi dengan cekap—semua kualiti yang menjadikan pembacaan terasa mudah. Fiksyen manusia, sebaliknya, sering merangkumi kerumitan, kehalusan, dan ketegangan yang tidak dapat diselesaikan, yang boleh terasa kurang memuaskan serta-merta walaupun ia lebih kaya dari segi artistik .
Bias 'pro-manusia' yang ditemui dalam kajian ini amat mendedahkan. Pembaca menghukum cerita yang mereka percaya ditulis oleh AI, walaupun apabila kandungannya sama dengan cerita yang mereka puji di bawah label 'manusia'. Bias atribusi ini mewujudkan paradoks: pelajar yang secara telus mendedahkan penggunaan AI mungkin berhadapan dengan penalti kredibiliti walaupun kerja mereka berkualiti tinggi, manakala mereka yang menyembunyikan penggunaan AI mungkin mendapat manfaat daripada keutamaan pembaca terhadap kepengarangan manusia yang dianggap .
Penemuan kajian ini menimbulkan cabaran asas untuk universiti dan dasar integriti akademik mereka:
Pengesanan tidak boleh dipercayai. Memandangkan pembaca yang terlatih pun berprestasi hampir dengan kebarangkalian rawak dalam membezakan AI daripada tulisan manusia, alat pengesanan plagiarisme tradisional dan pertimbangan pensyarah sahaja tidak boleh mengenal pasti penyerahan kerja yang dihasilkan AI dengan pasti .
Literasi AI adalah langkah balas yang paling berkesan. Kajian mendapati bahawa kebiasaan dengan sistem AI meningkatkan keupayaan pengesanan, mencadangkan bahawa universiti harus melabur dalam latihan literasi AI untuk kedua-dua pelajar dan fakulti dan bukannya bergantung semata-mata pada penguatkuasaan .
Reka bentuk pentaksiran perlu difikirkan semula. Jika AI boleh menghasilkan penulisan yang dinilai oleh pembaca sebagai sama atau lebih unggul daripada kerja manusia, esei yang dibawa pulang dan tugasan penulisan standard mungkin tidak lagi sah sebagai ukuran kebolehan pelajar individu. Universiti mesti mempertimbangkan semula kemahiran apa yang sebenarnya mereka nilai dan bagaimana .
Dasar integriti akademik mesti berkembang. Kajian ini mencadangkan bahawa pendekatan yang lebih bernuansa diperlukan—satu yang mentakrifkan penggunaan AI yang boleh diterima berbanding tidak boleh diterima, menekankan proses dan refleksi berbanding produk akhir, dan menggabungkan literasi AI ke dalam kurikulum .
Dr. Weisberg menegaskan bahawa penemuan ini tidak menjadikan penulis manusia usang: "Manusia menulis sebagai satu bentuk ekspresi diri yang kreatif atau untuk mencabar diri kita sendiri, atau untuk memahami pengalaman kita. Hakikat bahawa AI boleh menjana cerita seperti manusia tidak mengubah semua itu" .