AI资讯 / 产业

产业 / 媒体

ChatGPT发布后网络AI生成文本急剧增加

The Decoder

皮尤研究中心(Pew Research Center)对近50万个英文网页进行分析,发现自ChatGPT于2022年底上线以来,网络上机器生成文本的比例持续攀升。研究使用Common Crawl网络存档数据,并借助AI检测工具Open Pangram进行识别。结果显示,在2026年7月的样本中,约10%的页面整体呈现AI写作特征;若仅筛选ChatGPT发布后上线的页面,这一比例跃升至超过三分之一。商业.com域名网站含AI文本的概率约为.edu和.gov网站的十倍。与此同时,破折号、牛津逗号以及「delve」「pivotal」「tapestry」等AI惯用词汇在网络上的出现频率也大幅上升。不过,研究者也指出,当前检测工具难以区分全自动生成内容与人机协作写作,相关结论存在一定局限性。

皮尤研究中心近期发布的一项大规模分析显示,自ChatGPT于2022年底推出以来,网络上AI生成文本的占比出现显著跃升。研究团队从Common Crawl网络存档中抽取近50万个英文网页,使用开源检测工具Open Pangram对每个页面进行机器写作特征识别。在2026年7月的整体样本中,约10%的页面被判定具有明显的AI写作痕迹,而这一数字在ChatGPT发布后新上线的页面中超过了三分之一。

从域名类型来看,差异尤为悬殊。约十分之一的.com商业网站页面显示出AI写作特征,.org域名网站的比例约为4.6%,而.edu教育机构和.gov政府网站的比例均仅约1%。这意味着商业网站使用AI生成内容的可能性,大约是学术和政府网站的十倍。这一差距折射出商业内容生产对效率的高度追求,以及AI写作工具在营销、电商等领域的快速渗透。

语言层面的变化同样引人注目。皮尤的分析发现,破折号(em dash)在网络文本中的出现频率自2023年以来翻了近一倍,牛津逗号的使用量增长了63%。「delve」「interplay」「testament」「pivotal」「landscape」「tapestry」「bolstered」「crucial」「meticulous」「vibrant」等被视为AI写作标志性词汇的使用频率均超过翻倍。以「it's not just X, it's Y」为模板的否定式并列句型出现频率近乎增至三倍,另有研究发现企业公关文件中该句型自2022年以来增加了四倍。

这项研究并非孤例。2026年4月,帝国理工学院、互联网档案馆与斯坦福大学联合发布的研究同样得出相近结论,认为约35%的新发布网站内容为全部或部分AI生成,且AI文本之间的语义相似度更高,整体语气也更为积极正面。两项研究共同勾勒出一幅AI写作快速扩张的网络图景,但研究者也提醒,公众对AI负面影响的感知往往超出数据实际支撑的范围。

然而,这类研究面临一个根本性的方法论难题:如何定义「AI文本」至今没有共识。从完全自动化生成的内容,到人类草稿经AI润色,再到仅有少数句子借助AI完成,写作方式的光谱极为宽泛。Open Pangram等检测工具只能对文本是否由机器主导作出粗略判断,无法可靠识别AI介入的程度与阶段,误判情况也时有发生。这一局限性使得相关数据的解读需要保持审慎。

围绕AI文本的公共讨论正日趋两极化。Anthropic近期宣布计划为Claude输出内容添加水印一事,再次引发广泛争议。职场研究也记录到,使用AI写作工具在某些场合已形成一定的社会污名,无论是过度依赖还是刻意回避,都难以真实反映人们实际与AI协作写作的复杂现实。随着AI工具的普及持续加速,如何在效率与真实性之间找到平衡,将成为越来越重要的议题。

要点

  • ChatGPT发布后上线的英文网页中,超过三分之一显示出AI写作特征,整体样本中这一比例约为10%
  • 商业.com网站含AI生成内容的概率约为教育和政府网站的十倍,商业驱动是AI写作扩散的核心动力
  • 破折号、牛津逗号及「delve」「pivotal」等AI惯用词汇在网络文本中的出现频率自2023年以来大幅攀升
  • 现有AI检测工具无法可靠区分全自动生成与人机协作写作,相关研究结论存在固有局限
  • 帝国理工学院等机构的独立研究与皮尤结论高度吻合,共同印证AI写作在网络内容中的快速扩张趋势
查看原始来源

原始标题:Pew study confirms sharp rise of AI-written text on the web since ChatGPT's launch

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。