人类写不过AI?最新研究:读者更爱AI生成的故事,但就是不愿承认
1682人参与实验AI故事在沉浸感和质量上全面胜出但算法厌恶让读者嘴硬小伙伴们ChatGPT写的小说真的比人类作家写得更好吗这听起来像是个挑衅性的问题但剑桥大学期刊《Judgment and Decision Making》发布的一项最新研究给出了让人大跌眼镜的实证数据当读者在不知情的情况下阅读短篇小说时他们不仅觉得AI生成的故事更引人入胜还在质量评分上给AI打了更高的分数。但事情远没有这么简单人类对AI的偏见在这个实验里展现得淋漓尽致。这项研究直击了当下内容创作领域最核心的焦虑。2023年美国编剧工会WGA大罢工的核心诉求之一就是编剧们恐惧自己的劳动价值会被AI生成的剧本轻易取代。但一个前置的灵魂拷问是普通人真的能分辨出一段创意文字究竟出自碳基大脑还是硅基模型吗为了回答这个问题研究团队设计了两项实验。第一项研究聚焦于感知差异第二项研究则直接把人类和AI的作品放在一起进行图灵测试式的硬碰硬对比。1682人参与一场精心设计的阅读实验研究1的样本量相当可观最终样本包含1,682名通过Prolific平台招募的成年参与者843名女性809名男性26名非二元/第三性别2名其他2名拒绝回答平均年龄45.9岁年龄跨度18-81岁。该样本在性别、年龄和种族特征上代表美国人口。参与者被随机分配到四个实验条件之一构成一个2×2的因子设计他们要么读到人类写的小说要么读到ChatGPT生成的小说同时他们要么被告知这是人类写的要么被告知这是AI写的。也就是说有一半的人被“骗”了。图片说明A data table showing the distribution of 1,682 participants across four experimental conditions based on story origin and attribution. See long description.实验材料是三对短篇小说每对包含一篇人类作品和一篇对应的AI作品字数都在1000字左右约五分钟阅读量。比如第一对故事人类作品是Emilie Fox 2021年发表在《Longleaf Review》上的《FISH》而AI作品则是用ChatGPT 4.0生成的《Reflections in Still Water》提示词要求以文学杂志的风格从成年子女视角讲述代际生死与不确定性并以锦鲤为象征。为了衡量阅读体验研究者使用了改编版的Story World Absorption Scale故事世界沉浸量表涵盖注意力、代入感、情感参与和心智意象等维度。参与者需要在-3强烈反对到3强烈同意的量表上打分。该量表的Cronbachs alpha系数达到0.91内部一致性极佳。同时研究者还自编了10道题的感知故事质量量表从情节、角色、主题和风格四个维度评估alpha系数同样为0.91。AI完胜人类沉浸感与质量的双重碾压结果非常反直觉。在混合效应模型分析中研究者将故事条件和引导条件作为固定效应并将具体故事作为随机截距以排除不同文本本身带来的方差干扰。数据显示出显著的故事条件主效应读到AI生成故事的参与者M 1.42, SD 0.99其故事沉浸感评分显著高于读到人类故事的参与者M 1.00, SD 1.14b −0.43, p .05。在感知质量上结果如出一辙AI故事M 1.54, SD 1.00的质量评分同样显著高于人类故事M 0.97, SD 1.23b −0.62, p .01。图片说明A box plot comparing mean absorption ratings for G P T and human stories across two introduction conditions. See long description.图片说明A grouped box plot comparing mean perceived story quality ratings for G P T and human stories across A I and human introduction conditions. See long description.简单来说盲测状态下ChatGPT写的小说不仅更好读而且显得“写得更好”。这与此前多项研究发现的“AI内容更流畅、情感基调更积极从而更受人偏爱”的结论相吻合。在说明文或议论文中清晰流畅是优势但在虚构文学中一定的晦涩感往往被视为纯文学的特质。然而即便在这个领域AI依然凭借其流畅的生成能力赢得了读者的青睐。算法厌恶只要贴上AI标签评分立刻跳水如果实验到此为止那不过是又一次证明了AI文本生成能力的强大。但研究者紧接着揭示了人类心理中根深蒂固的“算法厌恶”。数据显示出显著的引导条件主效应当参与者被告知他们读的是人类写的故事时其沉浸感评分M 1.32, SD 1.07显著高于被告知读的是AI故事的人M 1.10, SD 1.10b 0.23, p .001。在质量评分上也是一样被告知是人类写的M 1.40, SD 1.11显著高于被告知是AI写的M 1.12, SD 1.19b 0.22, p .003。这意味着无论故事到底是谁写的只要给它贴上“AI生成”的标签读者就会本能地给出更低的评价。这种偏见非常顽固即便AI的实际表现已经超越了人类人们依然在心理上拒绝接受。更有意思的是参与者对AI态度的影响。通过ANCOVA分析发现对AI态度更积极的参与者给出的沉浸感评分整体更高F(1,1674) 117.94, p .001, h² .06。而且存在一个显著的交互效应当对AI持积极态度的参与者被告知故事是ChatGPT写的时候他们给出的评分甚至更高F(1,1674) 13.86, p .001, h² .007。图片说明A scatter plot with linear regression lines comparing story absorption ratings against attitudes toward A I for two introduction conditions. See long description.研究还设置了一个关于欺骗的追问环节。当研究者告诉参与者“我们可能在作者身份上骗了你”时发生了一个有趣的现象那些被告知真相的人比如读的是AI故事也被告知是AI写的反而比那些被欺骗的人更不相信最初被告知的话F(1,1678) 7.52, p .006, h² .004。不过所有置信度得分都接近0说明大家在被提示可能存在欺骗后基本都处于“我啥也不知道”的懵圈状态。强制二选一人类识别能力不如抛硬币如果说研究1证明了人类的偏见那么研究2则直接戳破了人类的自信。在研究2中424名参与者平均年龄38.5岁每人阅读一对故事一篇人类一篇AI然后被强制要求判断哪篇是AI写的哪篇是人类写的。结果令人震惊只有167名参与者39.39%正确选出了答案。通过精确比例检验发现这个正确率显著低于50%的随机瞎猜水平p .001。也就是说如果把人类和AI的小说放在一起让人挑人类的表现还不如抛硬币。更讽刺的是研究者统计了参与者判断时依赖的文本特征。结果显示那些报告依赖故事语言特征来做判断的参与者反而更容易选错χ²(1) 13.81, p .001。图片说明A data table showing the number and percentage of participants who selected specific story features as helpful, categorized by whether their response was correct or incorrect. See long description.人们往往觉得AI的语言会有某种机械感或特定模式于是盯着语言看结果却掉进了AI流畅性设下的陷阱把人类作品当成了AI或者反之。这表明大众在识别AI文本时关注的方向完全错了。专业知识对决懂AI比懂文学更管用研究2还引入了专业度的变量测量了参与者的AI专业知识、虚构文学专业知识以及对AI的态度。图片说明A statistical table presenting descriptive data for A I expertise, fictional literature expertise, and A I attitude scales. See long description.通过逻辑回归分析研究者发现了几个极具启发性的结论首先自评的AI专业知识对正确识别作者有显著的正向作用β .13, p .001。那些更懂AI、更常用ChatGPT的人确实更可能挑出哪篇是AI写的。其次自评的虚构文学专业知识对正确率毫无影响β −.006, p .87。你读再多的人类小说分析再多文本结构在分辨AI和人类写作这件事上也帮不上忙。这可能是因为文学专家习惯于分析语言的深层结构和作者意图而AI生成的文本恰恰能模仿这些表层特征导致文学专家的判断框架失效。最后对AI的积极态度同样对正确识别有显著正向作用β 1.004, p .008。越相信AI能干好活的人越能认出AI干的活。图片说明A correlation matrix table showing the relationships between Fictional literature expertise, A I expertise, and A I attitudes. See long description.相关性分析也印证了这一点AI态度与AI专业知识得分之间存在显著正相关r(422) .20, p .001AI专业知识与虚构文学专业知识之间也存在弱正相关r(422) .11, p .027。创作者的真正危机与转机这项研究传递出的信号极其复杂。一方面大语言模型生成的虚构故事在普通读者眼中已经不仅达到了人类水平甚至超越了人类水平。读者在盲测中更投入、评价更高。这意味着如果内容平台不加以标注读者可能根本不在乎甚至更偏爱AI生成的内容。但另一方面算法厌恶是一堵巨大的墙。只要标明“AI生成”评价就会大打折扣。这种心理机制是内容创作者在未来很长一段时间内需要博弈的焦点。对于写作者而言单纯依靠“人类”这个标签来溢价的时代正在过去。当AI的流畅性和情感基调能够轻易俘获读者时人类创作者或许需要去探索那些AI难以触及的领域——比如真正晦涩的文学性探索或者是基于真实人类生命经验的独特质感而不是在流畅好读这个维度上与模型死磕。至于普通读者下次如果你读到一篇让你深深沉浸的短篇小说在感叹人类作家笔力深厚之前或许得先想想这真的不是ChatGPT在五秒钟里生成的吗