這項研究由維拉諾瓦大學(Villanova University)的Sydney Sears與Dr. Deena Skolnick Weisberg主持,使用了三篇由已出版人類作者創作的短篇故事,以及三篇由ChatGPT生成的相對應故事,題材與敘事元素均經過匹配。
研究分為三個部分,各自設計來釐清讀者感知的不同面向:
研究一(1,682名受試者): 每人閱讀一篇故事,並被告知——無論正確與否——該故事是由人類還是AI所寫。隨後他們根據品質和敘事沉浸感進行評分。
研究二(424名受試者): 受試者閱讀一篇人類創作與一篇AI生成的故事,但未被告知哪篇是哪篇。他們必須猜測每篇故事的作者。
研究三(481名受試者): 類似於盲讀設計,再次要求受試者判斷每篇故事出自人類還是ChatGPT。
結果在各個實驗中一致且驚人:
檢測失敗。 在研究二中,正確辨識率僅39.93%——比隨機猜測還差。在研究三中,正確率為51.97%,在統計上與隨機猜測無異。
AI故事評分更高。 在所有研究中,AI生成的故事在品質和讀者沉浸感方面都獲得更高評分。
「親人類」歸因偏誤。 獲得最高評分的故事,是那些受試者被告知由人類撰寫的故事——即使它們實際上是AI生成的。 研究人員認為,這揭示了讀者對被視為「真實人類」敘事的根深蒂固偏見。
AI素養有幫助;文學專業知識則無。 自我報告的AI專業知識每增加一分,正確辨識的機率便提高14%。在經過驗證的AI素養量表(AILS)上每增加一分,檢測機率則提高33%。
Dr. Weisberg解釋了為何AI寫作在這些指標上可能勝過人類作品:AI寫作「傾向於更清晰、更直接、更容易處理」,而人類創作的故事「往往更為微妙且複雜」。她補充說:「人們通常偏好可預測性,因為困難或微妙的材料需要更多腦力。」
這項研究建立在越來越多關於AI生成文本如何被感知的證據之上。AI寫作的散文傾向於避免含糊其辭,遵循可預測的敘事結構,並有效率地提供結局——這些特質讓閱讀過程毫不費力。相反地,人類小說往往擁抱複雜性、微妙之處和未解的張力,即使藝術性更豐富,卻可能讓人覺得不那麼立即滿足。
研究中揭露的「親人類」偏誤尤其值得關注。當讀者認為故事是AI所寫時,即使內容與他們在「人類」標籤下讚賞的故事完全相同,也會給予較低評分。這種歸因偏誤造成了一個矛盾:誠實揭露AI使用的學生可能面臨信譽懲罰,即使他們的作品品質很高;而那些隱瞞AI使用的學生,反而可能受益於讀者對「人類作者」的偏好。
這項研究的發現對大學及其學術誠信政策構成了根本挑戰:
檢測不可靠。 由於即使是訓練有素的讀者,在區分AI與人類寫作時的表現也接近隨機猜測,傳統的抄襲檢測工具與教師判斷已無法可靠識別AI撰寫的作業。
AI素養是最有效的因應措施。 研究發現,對AI系統的熟悉度能提高檢測能力,這表明大學應該投資於學生和教職員的AI素養培訓,而非僅依賴執法機制。
評量設計需要重新思考。 如果AI能產出讀者認為與人類作品相當甚至更優的寫作,那麼回家作業和標準寫作任務可能不再是衡量個別學生能力的有效方式。大學必須重新思考他們究竟在評估哪些技能,以及如何評估。
學術誠信政策必須與時俱進。 研究建議需要更細緻的方法——明確界定可接受與不可接受的AI使用方式,強調過程與反思而非最終成果,並將AI素養融入課程。
Dr. Weisberg強調,這些發現並不意味人類作者將被淘汰:「人類寫作是一種創意自我表達的形式,是為了挑戰自己,或是為了理解我們的經驗。AI能產出類似人類的故事,並不會改變這些。」