Penelitian yang dilakukan oleh Sydney Sears dan Dr. Deena Skolnick Weisberg dari Villanova University, Amerika Serikat, ini menguji lebih dari 2.500 orang dewasa berusia 18 hingga 81 tahun yang direkrut melalui platform Prolific. Mereka menggunakan tiga cerita pendek asli karya penulis manusia yang sudah diterbitkan dan tiga cerita yang dibuat oleh ChatGPT dengan genre dan elemen naratif yang disesuaikan .
Studi ini terdiri dari tiga bagian, masing-masing dirancang untuk mengisolasi aspek persepsi pembaca yang berbeda:
Studi 1 (1.682 partisipan): Setiap orang membaca satu cerita dan diberi tahu—baik benar maupun salah—apakah cerita itu ditulis manusia atau AI. Mereka kemudian menilai kualitas dan daya serap cerita tersebut .
Studi 2 (424 partisipan): Partisipan membaca satu cerita tulisan manusia dan satu cerita buatan AI tanpa diberi tahu mana yang mana. Mereka kemudian harus menebak penulis masing-masing .
Studi 3 (481 partisipan): Desain baca buta serupa, lagi-lagi meminta partisipan mengidentifikasi apakah setiap cerita berasal dari manusia atau ChatGPT .
Hasilnya mencolok dan konsisten di semua eksperimen:
Gagal mendeteksi. Di Studi 2, identifikasi benar hanya 39,93%—lebih buruk dari tebakan acak. Di Studi 3, angkanya 51,97%, secara statistik tidak berbeda dari tebakan acak .
Cerita AI dinilai lebih tinggi. Di semua studi, cerita buatan AI mendapat nilai lebih tinggi untuk kualitas dan daya serap .
Bias atribusi 'pro-manusia'. Cerita dengan nilai tertinggi adalah cerita yang diberi tahu kepada partisipan bahwa itu ditulis manusia—padahal sebenarnya buatan AI . Para peneliti berpendapat ini mengungkap bias mendalam terhadap narasi yang dianggap otentik buatan manusia .
Literasi AI membantu; keahlian sastra tidak. Setiap peningkatan satu poin dalam keahlian AI yang dilaporkan sendiri terkait dengan peningkatan 14% dalam peluang identifikasi yang benar. Setiap poin pada Skala Literasi AI (AILS) yang tervalidasi berkaitan dengan peningkatan 33% dalam peluang deteksi .
Dr. Weisberg menjelaskan mengapa tulisan AI mungkin tampak lebih unggul dari karya manusia dalam metrik ini: tulisan AI "cenderung lebih jelas, lebih langsung, dan lebih mudah diproses," sementara cerita tulisan manusia "seringkali lebih halus dan kompleks." Ia menambahkan bahwa "orang pada umumnya lebih suka prediktabilitas, karena materi yang sulit atau halus membutuhkan lebih banyak tenaga otak" .
Studi ini melengkapi bukti yang berkembang tentang bagaimana teks buatan AI dipersepsikan. Prosa AI cenderung menghindari ambiguitas, mengikuti struktur naratif yang dapat diprediksi, dan memberikan resolusi secara efisien—semua kualitas yang membuat membaca terasa mudah. Sebaliknya, fiksi manusia sering kali merangkul kompleksitas, kehalusan, dan ketegangan yang tidak terselesaikan, yang bisa terasa kurang memuaskan meskipun secara artistik lebih kaya .
Bias 'pro-manusia' yang terungkap dalam studi ini sangat menarik. Pembaca menghukum cerita yang mereka yakini ditulis AI, bahkan ketika kontennya identik dengan cerita yang mereka puji di bawah label 'manusia'. Paradoks ini menciptakan situasi: mahasiswa yang secara transparan mengungkapkan penggunaan AI mungkin menghadapi penalti kredibilitas meskipun karya mereka berkualitas tinggi, sementara mereka yang menyembunyikan penggunaan AI justru bisa diuntungkan oleh preferensi pembaca terhadap kepengarangan yang dianggap manusia .
Temuan studi ini menimbulkan tantangan fundamental bagi universitas dan kebijakan integritas akademik mereka:
Deteksi tidak bisa diandalkan. Karena bahkan pembaca terlatih pun berkinerja mendekati tebakan acak dalam membedakan AI dari tulisan manusia, alat deteksi plagiarisme tradisional dan penilaian instruktur saja tidak dapat diandalkan untuk mengidentifikasi kiriman yang dibuat AI .
Literasi AI adalah penangkal paling efektif. Studi menemukan bahwa keakraban dengan sistem AI meningkatkan kemampuan deteksi, menunjukkan bahwa universitas harus berinvestasi dalam pelatihan literasi AI untuk mahasiswa dan dosen, bukan hanya mengandalkan penegakan aturan .
Desain penilaian perlu dipikirkan ulang. Jika AI dapat menghasilkan tulisan yang dinilai pembaca setara atau lebih unggul dari karya manusia, esai yang dikerjakan di rumah dan tugas menulis standar mungkin tidak lagi menjadi ukuran yang valid dari kemampuan individu mahasiswa. Universitas harus mempertimbangkan kembali keterampilan apa yang sebenarnya dinilai dan bagaimana caranya .
Kebijakan integritas akademik harus berkembang. Studi ini menyarankan perlunya pendekatan yang lebih bernuansa—satu yang mendefinisikan penggunaan AI yang dapat diterima versus yang tidak dapat diterima, menekankan proses dan refleksi di atas produk akhir, dan mengintegrasikan literasi AI ke dalam kurikulum .
Dr. Weisberg menekankan bahwa temuan ini tidak membuat penulis manusia menjadi usang: "Manusia menulis sebagai bentuk ekspresi diri kreatif atau untuk menantang diri sendiri, atau untuk memahami pengalaman kita. Fakta bahwa AI dapat menghasilkan cerita mirip manusia tidak mengubah semua itu" .