Nghiên cứu được thực hiện bởi Sydney Sears và Tiến sĩ Deena Skolnick Weisberg tại Đại học Villanova (Mỹ), đã thử nghiệm trên hơn 2.500 người trưởng thành từ 18 đến 81 tuổi được tuyển dụng thông qua Prolific. Nghiên cứu sử dụng ba truyện ngắn nguyên bản do các tác giả xuất bản viết và ba truyện tương ứng do ChatGPT tạo ra, tất cả đều được đồng bộ về thể loại và các yếu tố tự sự .
Nghiên cứu được cấu trúc thành ba phần, mỗi phần được thiết kế để cô lập các khía cạnh khác nhau trong nhận thức của người đọc:
Nghiên cứu 1 (1.682 người tham gia): Mỗi người đọc một câu chuyện duy nhất và được thông báo (đúng hoặc sai) rằng nó được viết bởi con người hay AI. Sau đó, họ đánh giá chất lượng và mức độ cuốn hút của câu chuyện .
Nghiên cứu 2 (424 người tham gia): Người tham gia đọc một truyện do con người viết và một truyện do AI tạo ra mà không được cho biết truyện nào là của ai. Sau đó, họ phải đoán tác giả của mỗi truyện .
Nghiên cứu 3 (481 người tham gia): Một thiết kế đọc mù tương tự, một lần nữa yêu cầu người tham gia xác định xem mỗi câu chuyện đến từ con người hay ChatGPT .
Kết quả rất ấn tượng và nhất quán trong tất cả các thí nghiệm:
Không thể phát hiện. Trong Nghiên cứu 2, tỷ lệ nhận dạng đúng chỉ là 39,93% – tệ hơn cả ngẫu nhiên. Trong Nghiên cứu 3, tỷ lệ này là 51,97%, không khác biệt có ý nghĩa thống kê so với ngẫu nhiên .
Truyện của AI được đánh giá cao hơn. Trong tất cả các nghiên cứu, các câu chuyện do AI tạo ra nhận được đánh giá cao hơn về cả chất lượng và mức độ cuốn hút .
'Thành kiến thiên vị con người'. Những câu chuyện được đánh giá cao nhất là những câu chuyện mà người tham gia được nói là do con người viết – ngay cả khi chúng thực sự do AI tạo ra . Các nhà nghiên cứu cho rằng điều này cho thấy một sự thiên vị sâu sắc đối với các câu chuyện được coi là có tính xác thực của con người .
Kiến thức về AI giúp ích; chuyên môn văn học thì không. Cứ mỗi điểm tăng lên trong mức độ chuyên môn AI tự báo cáo có liên quan đến việc tăng 14% khả năng nhận dạng đúng. Mỗi điểm trên Thang đo Kiến thức AI (AILS) đã được xác nhận tương ứng với mức tăng 33% khả năng phát hiện .
Tiến sĩ Weisberg giải thích tại sao văn bản của AI có vẻ vượt trội hơn tác phẩm của con người: văn bản AI "có xu hướng rõ ràng, trực tiếp và dễ xử lý hơn," trong khi các câu chuyện do con người viết "thường tinh tế và phức tạp hơn." Bà nói thêm rằng "mọi người thường thích sự dễ đoán hơn, vì những tài liệu khó hoặc tinh tế đòi hỏi nhiều sức lực của não bộ hơn" .
Nghiên cứu này dựa trên một lượng bằng chứng ngày càng tăng về cách văn bản do AI tạo ra được cảm nhận. Văn xuôi do AI viết có xu hướng tránh sự mơ hồ, tuân theo các cấu trúc tường thuật dễ đoán và mang lại các giải pháp một cách hiệu quả – tất cả những phẩm chất này làm cho việc đọc trở nên dễ dàng. Ngược lại, tiểu thuyết của con người thường chấp nhận sự phức tạp, tinh tế và căng thẳng chưa được giải quyết, điều này có thể khiến người đọc cảm thấy không hài lòng ngay lập tức ngay cả khi nó phong phú hơn về mặt nghệ thuật .
Sự 'thiên vị con người' được phát hiện trong nghiên cứu đặc biệt rõ ràng. Độc giả đã hạ điểm những câu chuyện mà họ tin là do AI viết, ngay cả khi nội dung giống hệt với những câu chuyện mà họ khen ngợi khi được gắn nhãn 'con người'. Nghịch lý này tạo ra một tình huống: sinh viên công khai sử dụng AI có thể phải đối mặt với án phạt về độ tin cậy ngay cả khi bài làm của họ chất lượng cao, trong khi những người che giấu việc sử dụng AI có thể được hưởng lợi từ sự ưa thích của người đọc đối với tác giả được cho là con người .
Những phát hiện của nghiên cứu đặt ra những thách thức cơ bản cho các trường đại học và các chính sách về tính chính trực học thuật của họ:
Phát hiện là không đáng tin cậy. Vì ngay cả những độc giả được đào tạo cũng có khả năng nhận biết ngang với ngẫu nhiên khi phân biệt văn bản AI với văn bản con người, các công cụ phát hiện đạo văn truyền thống và phán đoán của giảng viên một mình không thể xác định đáng tin cậy các bài nộp do AI tạo ra .
Kiến thức AI là biện pháp đối phó hiệu quả nhất. Nghiên cứu phát hiện ra rằng sự quen thuộc với các hệ thống AI đã cải thiện khả năng phát hiện, cho thấy các trường đại học nên đầu tư vào đào tạo kiến thức AI cho cả sinh viên và giảng viên thay vì chỉ dựa vào các biện pháp trừng phạt .
Cần thiết kế lại các bài đánh giá. Nếu AI có thể tạo ra văn bản mà người đọc đánh giá là ngang bằng hoặc vượt trội so với tác phẩm của con người, các bài luận mang về nhà và bài tập viết tiêu chuẩn có thể không còn là thước đo hợp lệ cho khả năng của từng sinh viên. Các trường đại học phải xem xét lại những kỹ năng nào đang được đánh giá và đánh giá như thế nào .
Chính sách chính trực học thuật phải phát triển. Nghiên cứu cho thấy cần có một cách tiếp cận tinh tế hơn – một cách tiếp cận xác định việc sử dụng AI có thể chấp nhận được và không thể chấp nhận được, nhấn mạnh vào quy trình và sự suy ngẫm hơn là sản phẩm cuối cùng, và đưa kiến thức AI vào chương trình giảng dạy .
Tiến sĩ Weisberg nhấn mạnh rằng những phát hiện này không làm cho các tác giả là con người trở nên lỗi thời: "Con người viết như một hình thức thể hiện bản thân sáng tạo hoặc để thử thách bản thân, hoặc để hiểu những trải nghiệm của mình. Việc AI có thể tạo ra những câu chuyện giống con người không thay đổi điều đó" .