产业 / 媒体
大多数人做不到
一项发表于学术期刊《判断与决策》的研究揭示,普通读者在区分AI生成与人类原创短篇小说方面表现堪忧。研究共分两个阶段:第一阶段邀请1682名成年人阅读6篇短篇小说(3篇人类创作、3篇由ChatGPT生成),并对故事的吸引力、阅读体验和整体质量打分;第二阶段则让905名参与者直接判断两篇主题相近的故事哪篇出自人类之手。结果显示,在第二阶段的一项实验中,参与者的正确率仅约40%,甚至低于随机猜测水平,另一项实验正确率也仅为52%。研究还发现,阅读AI生成故事的参与者普遍认为其质量更高,但当被告知故事由人类创作时,评分又会随之上升。研究主要作者Weisberg指出,AI写作能力已需被重新审视,但这并不意味着人类写作的价值因此消失。
这项研究由美国宾夕法尼亚州维拉诺瓦大学的Deena Skolnick Weisberg博士主导,成果发表于学术期刊《判断与决策》。研究第一阶段共招募1682名成年人,让他们阅读6篇短篇小说,其中3篇由人类作家创作,另外3篇由ChatGPT生成,且每篇AI作品都与某篇人类作品主题相近。研究人员会告知参与者每篇故事的作者身份,但这一信息并不总是准确的,以此测试标签对评价的影响。
评分结果呈现出一个耐人寻味的双重现象:从实际阅读体验来看,阅读AI生成故事的参与者普遍认为这些故事更引人入胜、质量更高;然而一旦被告知某篇故事出自人类之手,参与者给出的评分便会显著提升。这说明读者对作者身份的预期会直接干预其主观感受,而非单纯依赖文本本身的质量作出判断。参与者对AI的整体态度同样影响评价——对AI持正面看法者,在得知故事由ChatGPT创作后给出的评分明显高于对AI持负面态度的参与者。
研究第二阶段共有905名成年人参与,他们需要从两篇主题相同的故事中判断哪篇由人类创作。在其中一项实验里,参与者的正确率约为40%,甚至低于随机猜测的50%基准线;另一项实验的正确率也仅为52%,几乎与随机猜测持平。研究人员据此得出结论:没有普遍证据表明参与者能够有效区分人类创作与AI生成的故事。值得注意的是,自称有丰富阅读或写作经验的参与者,其判断准确率并未因此提高,但对AI系统越熟悉的人,识别准确率相对更高。
Weisberg对此解释称,AI写作存在某种特定风格,人们可以通过练习逐渐学会识别,就像辨认不同人类作者的写作风格一样。她同时强调,AI能够生成质量可观的故事,并不意味着写作这件事应该拱手让给机器。在她看来,人类写作承载着创造性的自我表达、自我挑战以及梳理个人经历的功能,这些价值不会因AI的能力提升而消失。她也指出,科技公司借助AI批量生产的小说,与人类作家倾注心血的创作之间,存在本质上的差异。
不过,并非所有学者都对这一研究持温和立场。英国伯明翰大学电影与创意写作教授Luke Kennard对AI的定性更为严苛。他指出,人类倾向于将AI拟人化,但AI的本质不过是基于海量数据运行的预测代码,其背后是高耗能、高成本且对周边社区造成负面影响的超大型数据中心。Kennard强调,AI并非拼写检查工具那样的普通辅助手段,而是一种更深层的威胁。他认为,AI能够生成连贯的文本并不令人惊讶,因为其训练数据本就来自数千年的人类创作积累,真正值得追问的是:这一切的代价是否值得。
要点
- 在区分AI与人类短篇小说的实验中,参与者正确率最低仅约40%,低于随机猜测水平,表明普通读者难以有效辨别两者差异。
- 读者对故事的评价受作者身份标签影响显著:被告知是人类创作时评分更高,但实际阅读体验中AI生成的故事反而获得更高的吸引力评分。
- 对AI系统越熟悉的参与者,识别AI写作的准确率越高,而自称有丰富阅读或写作经验者并未表现出明显优势。
- 研究主要作者Weisberg认为,AI写作能力的提升需要被重新认识,但人类写作所承载的自我表达与经历梳理等价值不会因此消失。
- 批评者指出,AI生成内容的能力不应脱离其背后的资源消耗与数据来源争议来单独评价。