呢項研究由美國維拉諾瓦大學(Villanova University)嘅Sydney Sears同Dr. Deena Skolnick Weisberg帶領,透過Prolific平台招募咗超過2500名18至81歲嘅成年受試者。研究使用咗三篇由已出版人類作者創作嘅原創短篇小說,以及三篇由ChatGPT生成嘅對應故事,全部喺體裁同敘事元素上都配對好。
研究分為三個部分,每個部分都針對讀者感知嘅唔同方面:
研究一(1,682名參與者): 每人讀一篇故事,並被告知——無論正確定唔正確——呢篇係人類定AI寫嘅。然後佢哋要為故事嘅質素同投入程度評分。
研究二(424名參與者): 參與者讀一篇人類寫同埋一篇AI生成嘅故事,但唔被告知邊篇打邊篇。然後佢哋要猜測每篇嘅作者。
研究三(481名參與者): 類似嘅盲讀設計,再次要求參與者判斷每篇故事係嚟自人類定ChatGPT。
結果非常一致而且顯著:
檢測失敗。 喺研究二,正確識別率只有39.93%——比亂猜仲差。喺研究三,正確率係51.97%,統計上同隨機猜測冇分別。
AI故事獲更高評價。 喺所有研究中,AI生成嘅故事無論喺質素定係引人入勝程度都獲得更高評分。
「親人類」歸因偏見。 獲得最高評分嘅故事,係參與者被告知由人類寫嗰啲——即使佢哋實際上係AI生成嘅。研究人員認為呢個現象揭示咗一種根深柢固嘅偏見:讀者對被認為係「真人創作」嘅敘事有強烈偏好。
AI知識有幫助;文學專業冇幫助。 自我報告嘅AI專業知識每增加1分,正確識別嘅機率就增加14%。喺經過驗證嘅AI素養量表(AILS)上每增加1分,檢測機率就增加33%。
Dr. Weisberg解釋咗點解AI寫作喺呢啲指標上可能表現得比人類好:AI寫作「通常更清晰、更直接、更容易處理」,而人類寫嘅故事「往往更微妙、更複雜」。佢補充話:「人一般偏好可預測性,因為困難或微妙嘅材料需要更多腦力」。
呢項研究建基於愈來愈多關於AI生成文本點樣被感知嘅證據。AI寫嘅散文傾向避免歧義,遵循可預測嘅敘事結構,並有效率地提供結局——所有呢啲特質都令閱讀感覺毫不費力。相比之下,人類小說往往擁抱複雜性、微妙同未解決嘅張力,即使喺藝術上更豐富,但即時滿足感可能冇咁強。
研究揭示嘅「親人類偏見」尤其值得注意。讀者會處罰佢哋認為係AI寫嘅故事,即使內容同佢哋喺「人類」標籤下讚賞嘅故事一模一樣。呢種歸因偏見造成一個矛盾:學生如果誠實披露用咗AI,即使作品質素好高都可能面對可信度懲罰;而隱瞞用AI嘅學生反而可能因為讀者對「真人作者」嘅偏好而得益。
呢項研究嘅發現對大學同佢哋嘅學術誠信政策帶嚟根本性挑戰:
檢測好唔可靠。 既然連受過訓練嘅讀者喺分辨AI同人類寫作方面都接近隨機猜測,傳統抄襲檢測工具同老師嘅判斷單獨嚟講都唔能夠可靠識別AI提交嘅作品。
AI素養係最有效嘅應對措施。 研究發現對AI系統嘅熟悉程度改善咗檢測能力,意味大學應該投資AI素養培訓畀學生同教職員,而唔係單靠執法。
考核設計需要重新諗過。 如果AI可以產生讀者認為同人類作品一樣好甚至更好嘅寫作,咁帶返屋企做嘅論文同標準寫作作業可能唔再係衡量學生個人能力嘅有效方法。大學必須重新考慮佢哋實際上喺度評估緊啲乜嘢技能,以及點樣評估。
學術誠信政策必須進化。 研究建議需要一個更細緻嘅方法——定義可接受同唔可以接受嘅AI使用方式,強調過程同反思多過最終成品,並將AI素養融入課程。
Dr. Weisberg強調呢啲發現並唔代表人類作者被淘汰:「人類寫作係一種創意自我表達嘅形式,或者係為咗挑戰自己,或者為咗理解我哋嘅經歷。AI可以生成似人類嘅故事呢個事實,並唔會改變呢啲嘢」。