AI资讯 / 产业

产业 / 媒体

AI写的短篇小说评分更高,但读者一旦知道作者是机器,评分立刻下滑

The Decoder

一项发表于《判断与决策》期刊的新研究显示,普通读者几乎无法区分ChatGPT生成的短篇小说与人类作家的作品。研究共设计三组实验,累计招募超过2500名参与者,结果显示无论是单独阅读还是对比阅读,受试者的判断准确率均与随机猜测无异。更值得关注的是,在不知道作者身份的情况下,AI生成的故事在感知质量和沉浸感两项指标上均显著高于人类作品。然而,一旦参与者得知故事出自AI之手,评分便明显下降。研究者认为,AI文本通常更流畅、更易读、情感基调更积极,这些特质有助于提升读者的即时体验,但未必代表更高的文学价值。此外,参与者对AI的既有态度也会影响评分走向,而自称有丰富阅读经验的人并不比普通读者更擅长识别AI作品。

研究人员悉尼·西尔斯与迪娜·斯科尔尼克·韦斯伯格在第一组实验中招募了1682名参与者,每人阅读一篇约1000字的短篇小说。其中三篇来自知名文学杂志和短篇小说集,另外三篇由ChatGPT 4.0生成,提示词参照了人类原作的主题、风格与叙事视角。参与者被随机告知故事的作者是人类或AI,但这一信息对每组中的一半人来说是虚假的,由此形成了一个真实与误导交叉的实验设计。

实验结果显示,AI生成的故事在感知质量和沉浸感上均明显胜出。在负3到正3的评分量表上,AI故事的质量均分为1.54,人类故事为0.97;沉浸感方面,AI为1.42,人类为1.00。值得注意的是,无论故事实际由谁创作,只要参与者被告知作者是人类,评分就会普遍偏高;而一旦被告知是AI所写,评分则随之下滑,这一现象在对AI持怀疑态度的参与者中尤为明显。

在后续两组共905人参与的实验中,研究者进一步提高了难度——每位参与者同时阅读一篇人类作品和一篇AI作品,并被要求判断哪篇出自人类之手。即便在可以直接对比的情况下,参与者的识别准确率依然没有超过随机水平。唯一与识别能力呈正相关的因素,是参与者自述的AI使用经验,而非文学阅读经验。

研究者指出,AI文本之所以获得更高评分,可能与其固有的文本特征有关:语言更流畅、阅读障碍更少、情感表达更为积极。人类倾向于对认知负担较低的内容给予更高评价,而高质量的文学作品往往刻意制造阅读难度,要求读者主动参与意义建构。因此,评分高并不等同于文学价值高,两者之间存在本质差异。

短篇小说的体裁特点也在客观上有利于AI发挥。在1000字以内讲述一个连贯故事,与创作长篇小说所需的叙事能力截然不同,AI在前者上的表现更容易达到甚至超越人类水准。去年10月,石溪大学与哥伦比亚法学院的一项研究同样发现,当AI模型经过专门训练以模仿特定作家风格时,专业读者反而更频繁地偏好AI生成的文本,这进一步印证了AI在特定写作任务上的竞争力。

这项研究的核心结论颇具挑战性:AI已经能够生成被读者认为至少与人类作品旗鼓相当的创意内容,但大多数人仍然不相信AI具备这种能力。认知偏见与实际体验之间的落差,或许正是当前公众理解AI创作能力时最需要正视的问题。研究所有数据与材料均已在开放科学框架平台上公开发布。

要点

  • 超过2500名参与者在三组实验中均无法以高于随机猜测的准确率区分AI与人类所写的短篇小说。
  • AI生成故事在感知质量和沉浸感上评分更高,但一旦读者得知作者是AI,评分便显著下降。
  • 参与者对AI的既有态度会影响评分:AI友好者在知晓AI身份后评分更高,AI怀疑者则相反。
  • 自述AI使用经验有助于识别AI作品,而丰富的文学阅读经验对此并无帮助。
  • AI文本更流畅易读的特质提升了即时体验评分,但这与文学层面的高质量并不等同。
查看原始来源

原始标题:Readers rate AI-generated short stories higher than human ones until they learn a machine wrote them

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。