미국 빌라노바 대학(Villanova University)의 시드니 시어스(Sydney Sears)와 디나 스콜닉 와이즈버그(Deena Skolnick Weisberg) 박사가 주도한 이 연구는 프롤리픽(Prolific)을 통해 모집된 18세에서 81세 사이의 성인 2,500명 이상을 대상으로 진행됐다. 연구진은 출판된 인간 작가의 단편 소설 3편과 챗GPT가 생성한 동일 장르의 소설 3편을 사용했다 .
연구는 독자의 인식을 다양한 각도에서 분석하기 위해 세 단계로 설계됐다.
1차 연구 (1,682명): 각 참가자는 단 하나의 이야기를 읽고, 그것이 인간 또는 AI가 썼는지에 대한 정보를 정확하거나 부정확하게 제공받았다. 이후 이야기의 질과 몰입도를 평가했다 .
2차 연구 (424명): 참가자는 인간 작품과 AI 작품을 각각 하나씩 읽고, 어떤 것이 인간이 썼는지 AI가 썼는지 추측해야 했다 .
3차 연구 (481명): 2차 연구와 유사한 맹검(blind) 방식으로 진행됐다 .
실험 결과는 일관되면서도 충격적이었다.
구별 실패. 2차 연구에서 정확한 식별률은 고작 39.93%로, 무작위 추측보다 나쁜 수준이었다. 3차 연구에서는 51.97%로, 통계적으로 우연 수준과 다르지 않았다 .
AI 이야기가 더 높은 평가. 모든 실험에서 AI가 생성한 이야기는 품질과 몰입도 모두에서 더 높은 점수를 받았다 .
'인간'이라는 라벨의 힘: 가장 높은 평가를 받은 이야기는 참가자들이 '인간이 썼다'고 들었던 이야기였다. 실제로는 AI가 생성한 것이었음에도 말이다 . 연구진은 이것이 '진정한 인간의 창작물'이라고 인식되는 서사에 대한 깊은 편향을 드러낸다고 분석한다 .
AI 리터러시는 도움, 문학적 전문성은 무용. 스스로 평가한 AI 전문성이 1포인트 증가할 때마다 올바른 식별 확률이 14% 증가했다. 검증된 AI 리터러시 척도(AILS)에서 1포인트 상승은 식별 확률을 33% 높였다 .
와이즈버그 박사는 AI 글이 더 높은 평가를 받는 이유에 대해 "AI 글은 일반적으로 더 명확하고, 직접적이며, 처리하기 쉽다"고 설명했다. 반면 인간이 쓴 이야기는 "종종 더 미묘하고 복잡하다"며, "사람들은 일반적으로 예측 가능성을 선호하는데, 어렵거나 미묘한 자료는 더 많은 두뇌 활동을 필요로 하기 때문"이라고 분석했다 .
이 연구는 AI 생성 텍스트에 대한 인식에 관한 증가하는 증거 체계 위에 세워졌다. AI가 쓴 산문은 모호함을 피하고, 예측 가능한 서사 구조를 따르며, 효율적으로 결말을 제시하는 경향이 있다. 이 모든 특성은 독서를 수월하게 만든다. 반면 인간 소설은 종종 복잡성, 미묘함, 해결되지 않은 긴장감을 포함하여, 예술적으로는 더 풍부하더라도 즉각적인 만족감은 덜할 수 있다 .
연구에서 밝혀진 '프로휴먼 편향'은 특히 시사하는 바가 크다. 독자들은 AI가 썼다고 믿는 이야기에 대해 페널티를 주었다. 심지어 그 내용이 '인간 작품'이라는 라벨 아래 극찬을 받았던 내용과 동일했음에도 말이다. 이는 역설을 만든다. AI 사용을 투명하게 공개한 학생은 품질이 높더라도 신뢰도 하락을 겪는 반면, AI 사용을 숨긴 학생은 독자의 '인간 창작 선호' 편향 덕을 볼 수 있다는 것이다 .
이 연구 결과는 대학과 학문적 진실성 정책에 근본적인 도전을 제기한다.
탐지는 신뢰할 수 없다. 훈련된 독자조차 AI와 인간 글쓰기를 구별하는 데 있어 우연 수준의 성적을 보이므로, 전통적인 표절 탐지 도구나 교수자의 판단만으로는 AI가 작성한 과제를 신뢰성 있게 식별할 수 없다 .
AI 리터러시가 가장 효과적인 대응책이다. 연구는 AI 시스템에 대한 친숙함이 탐지 능력을 향상시킨다는 것을 보여주며, 단속(sanctions)에만 의존하기보다 학생과 교수 모두를 위한 AI 리터러시 교육에 투자해야 한다고 제안한다 .
평가 설계의 근본적 재검토가 필요하다. AI가 독자에게 동등하거나 우수하다고 판단되는 글을 생산할 수 있다면, 집에서 작성하는 에세이나 표준적인 글쓰기 과제는 더 이상 학생 개인의 능력을 측정하는 타당한 방법이 아닐 수 있다. 대학은 실제로 어떤 능력을 평가하고 있으며, 어떻게 평가할 것인지 재고해야 한다 .
학문적 진실성 정책은 진화해야 한다. 연구는 허용 가능한 AI 사용과 허용 불가능한 AI 사용을 정의하고, 최종 결과물보다 과정과 성찰을 강조하며, AI 리터러시를 교육 과정에 통합하는 보다 세심한 접근이 필요하다고 제안한다 .
와이즈버그 박사는 이 연구 결과가 인간 작가를 무의미하게 만들지는 않는다고 강조했다. "인간은 창작적 자기 표현의 형태로, 또는 자신에게 도전하기 위해, 혹은 자신의 경험을 이해하기 위해 글을 씁니다. AI가 인간과 같은 이야기를 생성할 수 있다는 사실이 이것을 바꾸지는 않습니다" .