1682人参与实验,AI故事在沉浸感和质量上全面胜出,但算法厌恶让读者嘴硬
小伙伴们,ChatGPT写的小说,真的比人类作家写得更好吗?这听起来像是个挑衅性的问题,但剑桥大学期刊《Judgment and Decision Making》发布的一项最新研究,给出了让人大跌眼镜的实证数据:当读者在不知情的情况下阅读短篇小说时,他们不仅觉得AI生成的故事更引人入胜,还在质量评分上给AI打了更高的分数。但事情远没有这么简单,人类对AI的偏见,在这个实验里展现得淋漓尽致。
这项研究直击了当下内容创作领域最核心的焦虑。2023年美国编剧工会(WGA)大罢工的核心诉求之一,就是编剧们恐惧自己的劳动价值会被AI生成的剧本轻易取代。但一个前置的灵魂拷问是:普通人真的能分辨出一段创意文字,究竟出自碳基大脑还是硅基模型吗?
为了回答这个问题,研究团队设计了两项实验。第一项研究聚焦于感知差异,第二项研究则直接把人类和AI的作品放在一起,进行图灵测试式的硬碰硬对比。
1682人参与:一场精心设计的阅读实验
研究1的样本量相当可观,最终样本包含1,682名通过Prolific平台招募的成年参与者(843名女性,809名男性,26名非二元/第三性别,2名其他,2名拒绝回答;平均年龄45.9岁,年龄跨度18-81岁)。该样本在性别、年龄和种族特征上代表美国人口。参与者被随机分配到四个实验条件之一,构成一个2×2的因子设计:他们要么读到人类写的小说,要么读到ChatGPT生成的小说;同时,他们要么被告知这是人类写的,要么被告知这是AI写的。也就是说,有一半的人被“骗”了。
图片说明:A data table showing the distribution of 1,682 participants across four experimental conditions based on story origin and attribution. See long description.
实验材料是三对短篇小说,每对包含一篇人类作品和一篇对应的AI作品,字数都在1000字左右(约五分钟阅读量)。比如第一对故事,人类作品是Emilie Fox 2021年发表在《Longleaf Review》上的《FISH》,而AI作品则是用ChatGPT 4.0生成的《Reflections in Still Water》,提示词要求以文学杂志的风格,从成年子女视角讲述代际生死与不确定性,并以锦鲤为象征。
为了衡量阅读体验,研究者使用了改编版的Story World Absorption Scale(故事世界沉浸量表),涵盖注意力、代入感、情感参与和心智意象等维度。参与者需要在-3(强烈反对)到3(强烈同意)的量表上打分。该量表的Cronbach's alpha系数达到0.91,内部一致性极佳。同时,研究者还自编了10道题的感知故事质量量表,从情节、角色、主题和风格四个维度评估,alpha系数同样为0.91。
AI完胜人类:沉浸感与质量的双重碾压
结果非常反直觉。在混合效应模型分析中,研究者将故事条件和引导条件作为固定效应,并将具体故事作为随机截距,以排除不同文本本身带来的方差干扰。
数据显示出显著的故事条件主效应:读到AI生成故事的参与者(M = 1.42, SD = 0.99),其故事沉浸感评分显著高于读到人类故事的参与者(M = 1.00, SD = 1.14;b = −0.43, p = .05)。在感知质量上,结果如出一辙:AI故事(M = 1.54, SD = 1.00)的质量评分同样显著高于人类故事(M = 0.97, SD = 1.23;b = −0.62, p = .01)。
图片说明:A box plot comparing mean absorption ratings for G P T and human stories across two introduction conditions. See long description.
图片说明:A grouped box plot comparing mean perceived story quality ratings for G P T and human stories across A I and human introduction conditions. See long description.
简单来说,盲测状态下,ChatGPT写的小说不仅更好读,而且显得“写得更好”。这与此前多项研究发现的“AI内容更流畅、情感基调更积极,从而更受人偏爱”的结论相吻合。在说明文或议论文中,清晰流畅是优势,但在虚构文学中,一定的晦涩感往往被视为纯文学的特质。然而,即便在这个领域,AI依然凭借其流畅的生成能力赢得了读者的青睐。
算法厌恶:只要贴上AI标签,评分立刻跳水
如果实验到此为止,那不过是又一次证明了AI文本生成能力的强大。但研究者紧接着揭示了人类心理中根深蒂固的“算法厌恶”。
数据显示出显著的引导条件主效应:当参与者被告知他们读的是人类写的故事时,其沉浸感评分(M = 1.32, SD = 1.07)显著高于被告知读的是AI故事的人(M = 1.10, SD = 1.10;b = 0.23, p = .001)。在质量评分上也是一样,被告知是人类写的(M = 1.40, SD = 1.11)显著高于被告知是AI写的(M = 1.12, SD = 1.19;b = 0.22, p = .003)。
这意味着,无论故事到底是谁写的,只要给它贴上“AI生成”的标签,读者就会本能地给出更低的评价。这种偏见非常顽固,即便AI的实际表现已经超越了人类,人们依然在心理上拒绝接受。
更有意思的是参与者对AI态度的影响。通过ANCOVA分析发现,对AI态度更积极的参与者,给出的沉浸感评分整体更高(F(1,1674) = 117.94, p < .001, h² = .06)。而且存在一个显著的交互效应:当对AI持积极态度的参与者被告知故事是ChatGPT写的时候,他们给出的评分甚至更高(F(1,1674) = 13.86, p < .001, h² = .007)。
图片说明:A scatter plot with linear regression lines comparing story absorption ratings against attitudes toward A I for two introduction conditions. See long description.
研究还设置了一个关于欺骗的追问环节。当研究者告诉参与者“我们可能在作者身份上骗了你”时,发生了一个有趣的现象:那些被告知真相的人(比如读的是AI故事,也被告知是AI写的),反而比那些被欺骗的人更不相信最初被告知的话(F(1,1678) = 7.52, p = .006, h² = .004)。不过,所有置信度得分都接近0,说明大家在被提示可能存在欺骗后,基本都处于“我啥也不知道”的懵圈状态。
强制二选一:人类识别能力不如抛硬币
如果说研究1证明了人类的偏见,那么研究2则直接戳破了人类的自信。在研究2中,424名参与者(平均年龄38.5岁)每人阅读一对故事(一篇人类,一篇AI),然后被强制要求判断哪篇是AI写的,哪篇是人类写的。
结果令人震惊:只有167名参与者(39.39%)正确选出了答案。通过精确比例检验发现,这个正确率显著低于50%的随机瞎猜水平(p < .001)。也就是说,如果把人类和AI的小说放在一起让人挑,人类的表现还不如抛硬币。
更讽刺的是,研究者统计了参与者判断时依赖的文本特征。结果显示,那些报告依赖故事语言特征来做判断的参与者,反而更容易选错(χ²(1) = 13.81, p < .001)。
图片说明:A data table showing the number and percentage of participants who selected specific story features as helpful, categorized by whether their response was correct or incorrect. See long description.
人们往往觉得AI的语言会有某种机械感或特定模式,于是盯着语言看,结果却掉进了AI流畅性设下的陷阱,把人类作品当成了AI,或者反之。这表明,大众在识别AI文本时,关注的方向完全错了。
专业知识对决:懂AI比懂文学更管用
研究2还引入了专业度的变量,测量了参与者的AI专业知识、虚构文学专业知识以及对AI的态度。
图片说明:A statistical table presenting descriptive data for A I expertise, fictional literature expertise, and A I attitude scales. See long description.
通过逻辑回归分析,研究者发现了几个极具启发性的结论:
首先,自评的AI专业知识对正确识别作者有显著的正向作用(β = .13, p < .001)。那些更懂AI、更常用ChatGPT的人,确实更可能挑出哪篇是AI写的。
其次,自评的虚构文学专业知识对正确率毫无影响(β = −.006, p = .87)。你读再多的人类小说,分析再多文本结构,在分辨AI和人类写作这件事上,也帮不上忙。这可能是因为文学专家习惯于分析语言的深层结构和作者意图,而AI生成的文本恰恰能模仿这些表层特征,导致文学专家的判断框架失效。
最后,对AI的积极态度同样对正确识别有显著正向作用(β = 1.004, p = .008)。越相信AI能干好活的人,越能认出AI干的活。
图片说明:A correlation matrix table showing the relationships between Fictional literature expertise, A I expertise, and A I attitudes. See long description.
相关性分析也印证了这一点:AI态度与AI专业知识得分之间存在显著正相关(r(422) = .20, p < .001),AI专业知识与虚构文学专业知识之间也存在弱正相关(r(422) = .11, p = .027)。
创作者的真正危机与转机
这项研究传递出的信号极其复杂。一方面,大语言模型生成的虚构故事在普通读者眼中,已经不仅达到了人类水平,甚至超越了人类水平。读者在盲测中更投入、评价更高。这意味着,如果内容平台不加以标注,读者可能根本不在乎,甚至更偏爱AI生成的内容。
但另一方面,算法厌恶是一堵巨大的墙。只要标明“AI生成”,评价就会大打折扣。这种心理机制是内容创作者在未来很长一段时间内需要博弈的焦点。对于写作者而言,单纯依靠“人类”这个标签来溢价的时代正在过去。当AI的流畅性和情感基调能够轻易俘获读者时,人类创作者或许需要去探索那些AI难以触及的领域——比如真正晦涩的文学性探索,或者是基于真实人类生命经验的独特质感,而不是在流畅好读这个维度上与模型死磕。
至于普通读者,下次如果你读到一篇让你深深沉浸的短篇小说,在感叹人类作家笔力深厚之前,或许得先想想:这真的不是ChatGPT在五秒钟里生成的吗?