Villanova Üniversitesi'nden Sydney Sears ve Dr. Deena Skolnick Weisberg tarafından yürütülen araştırma, Prolific platformu aracılığıyla toplanan 18 ila 81 yaş arası 2.500'den fazla yetişkin üzerinde test edildi. Çalışmada, yayımlanmış insan yazarların üç özgün kısa hikayesi ile ChatGPT tarafından oluşturulan ve tür ve anlatı öğeleri açısından eşleşen üç hikaye kullanıldı .
Çalışma, okuyucu algısının farklı yönlerini izole etmek için üç bölüm halinde yapılandırıldı:
1. Çalışma (1.682 katılımcı): Her kişi tek bir hikaye okudu ve kendisine bu hikayenin bir insan mı yoksa yapay zeka mı tarafından yazıldığı doğru ya da yanlış bir şekilde söylendi. Ardından hikayeyi kalite ve anlatıya dalma açısından puanladılar .
2. Çalışma (424 katılımcı): Katılımcılar, hangisinin hangisi olduğu söylenmeden bir insan yazılı ve bir yapay zeka üretimi hikaye okudular. Ardından her birinin yazarını tahmin etmeleri istendi .
3. Çalışma (481 katılımcı): Benzer bir kör okuma tasarımı olan bu çalışmada da katılımcılardan her hikayenin bir insana mı yoksa ChatGPT'ye mi ait olduğunu belirlemeleri istendi .
Sonuçlar deneyler boyunca tutarlı ve çarpıcıydı:
Tespit başarısızlığı. 2. Çalışmada doğru tanımlama oranı sadece %39,93'tü — rastgele şanstan daha kötü. 3. Çalışmada bu oran %51,97'ydi ve istatistiksel olarak şanstan farklı değildi .
Yapay zeka hikayeleri daha yüksek puan aldı. Tüm çalışmalarda, yapay zeka tarafından üretilen hikayeler hem kalite hem de okuyucuyu içine çekme açısından daha yüksek puanlar aldı .
'İnsan yanlısı' bir atıf önyargısı. En yüksek puan alan hikayeler, katılımcılara insan tarafından yazıldığı söylenen hikayelerdi — gerçekte yapay zeka tarafından üretilmiş olsalar bile . Araştırmacılar, bunun otantik olarak insan algılanan anlatılara yönelik derin bir önyargıyı ortaya çıkardığını savunuyor .
Yapay zeka okuryazarlığı yardımcı oluyor; edebi uzmanlık ise etkisiz. Kendi bildirdiği yapay zeka uzmanlığındaki her bir puanlık artış, doğru tanımlama olasılığında %14'lük bir artışla ilişkilendirildi. Geçerli bir Yapay Zeka Okuryazarlığı Ölçeği'ndeki (AILS) her puan, tespit olasılığında %33'lük bir artışa karşılık geldi .
Dr. Weisberg, yapay zeka yazılarının bu ölçütlerde neden insan çalışmalarından daha iyi görünebileceğini şöyle açıkladı: Yapay zeka yazıları "daha net, daha doğrudan ve işlenmesi daha kolay olma eğilimindedir", oysa insan yazılı hikayeler "genellikle daha incelikli ve karmaşıktır". Ayrıca "insanlar genellikle öngörülebilirliği tercih eder çünkü zor veya incelikli materyal daha fazla beyin gücü gerektirir" diye ekledi .
Çalışma, yapay zeka tarafından üretilen metinlerin nasıl algılandığına dair artan kanıtlar üzerine inşa edilmiştir. Yapay zeka tarafından yazılan düzyazı belirsizlikten kaçınma, öngörülebilir anlatı yapılarını takip etme ve sonuçları verimli bir şekilde sunma eğilimindedir — tüm bunlar okumayı zahmetsiz hissettiren özelliklerdir. Buna karşılık, insan kurgusu genellikle sanatsal olarak daha zengin olsa bile hemen tatmin edici gelmeyebilen karmaşıklığı, inceliği ve çözülmemiş gerilimi benimser .
Çalışmada ortaya çıkarılan 'insan yanlısı' önyargı özellikle aydınlatıcıdır. Okuyucular, yapay zeka tarafından yazıldığına inandıkları hikayeleri, içerik 'insan' etiketi altında övdükleri hikayelerle aynı olsa bile cezalandırdı. Bu atıf önyargısı bir paradoks yaratır: Yapay zeka kullanımını şeffaf bir şekilde açıklayan öğrenciler, çalışmaları yüksek kalitede olsa bile bir güvenilirlik cezasıyla karşı karşıya kalabilirken, yapay zeka kullanımını gizleyenler, okuyucuların algılanan insan yazarlığı tercihinden faydalanabilir .
Çalışmanın bulguları, üniversiteler ve akademik dürüstlük politikaları için temel zorluklar ortaya koyuyor:
Tespit güvenilmezdir. Eğitimli okuyucular bile yapay zeka yazısını insan yazısından ayırt etmede şans seviyesinde performans gösterdiğinden, geleneksel intihal tespit araçları ve eğitmen yargısı tek başına yapay zeka tarafından yazılan ödevleri güvenilir bir şekilde belirleyemez .
En etkili önlem yapay zeka okuryazarlığıdır. Çalışma, yapay zeka sistemlerine aşinalığın tespit yeteneğini geliştirdiğini buldu; bu da üniversitelerin yalnızca yaptırımlara güvenmek yerine hem öğrenciler hem de öğretim üyeleri için yapay zeka okuryazarlığı eğitimine yatırım yapması gerektiğini gösteriyor .
Değerlendirme tasarımının yeniden düşünülmesi gerekiyor. Yapay zeka, okuyucuların insan çalışmalarına eşit veya daha üstün olarak değerlendirdiği yazılar üretebiliyorsa, ev ödevi olarak verilen kompozisyonlar ve standart yazma ödevleri artık bireysel öğrenci yeteneğinin geçerli ölçütleri olmayabilir. Üniversiteler, hangi becerileri gerçekten değerlendirdiklerini ve bunu nasıl yapacaklarını yeniden düşünmelidir .
Akademik dürüstlük politikaları gelişmelidir. Çalışma, kabul edilebilir ve kabul edilemez yapay zeka kullanımını tanımlayan, nihai üründen çok süreç ve yansımayı vurgulayan ve yapay zeka okuryazarlığını müfredata dahil eden daha incelikli bir yaklaşıma ihtiyaç olduğunu göstermektedir .
Dr. Weisberg, bulguların insan yazarları geçersiz kılmadığını vurguladı: "İnsanlar bir kendini ifade etme biçimi olarak, kendimize meydan okumak için veya deneyimlerimizi anlamlandırmak için yazarlar. Yapay zekanın insan benzeri hikayeler üretebilmesi bunların hiçbirini değiştirmez" .