皮尤研究:ChatGPT发布后网络AI文本激增

摘要
皮尤研究中心分析近50万英文网页发现,自ChatGPT发布以来,超过三分之一的网页含AI生成文本,商业网站AI内容比例是教育或政府网站的十倍。
背景解释
该研究基于大量网页样本,量化了AI生成内容在网络上的扩散程度。商业网站的高比例可能影响信息可信度,提醒读者在获取信息时需保持警惕,但研究未涉及具体平台或影响评估。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
皮尤研究证实:ChatGPT 发布后,网络上 AI 生成文本急剧增加
皮尤研究证实:ChatGPT 发布后,网络上 AI 生成文本急剧增加

- 皮尤研究中心对近 50 万个英文网页的分析发现,在 ChatGPT 发布后发布的页面中,超过三分之一显示出 AI 生成文本的迹象。
- 使用 Open Pangram 检测工具分析了 Common Crawl 网络档案中的文本。商业 .com 域名包含 AI 生成文本的频率大约是 .edu 或 .gov 网站的十倍。
- 不过,该分析存在局限性,主要是因为当前的检测工具几乎无法区分完全自动化的文本和仅部分由 AI 辅助的写作。
皮尤研究中心分析了近 50 万个英文网页,以寻找 AI 生成的内容。自 ChatGPT 推出以来,网络上机器撰写的文本比例急剧上升。
这些文本来自Common Crawl网络档案,并使用 AI 检测工具Open Pangram检查机器作者身份的迹象。在 2026 年 7 月的样本中,所有被检查的页面中约有 10% 显示出明显的 AI 作者身份迹象。
将样本过滤为仅包含 ChatGPT 发布后发布的页面,情况发生了巨大变化。根据分析,这些较新的页面中超过三分之一显示出 AI 作者身份的迹象。这一趋势始于 2022 年底的 ChatGPT,此后可能由 AI 生成的网页内容比例稳步上升。广告

自 ChatGPT 发布以来,包含 AI 生成文本的页面比例急剧上升。| 图片来源:皮尤研究中心
大约十分之一的 .com 域名页面显示出 AI 作者身份的迹象,而 .org 域名占 4.6%,.edu 和 .gov 域名各仅占约 1%。这使得商业网站包含 AI 撰写文本的可能性大约是学校或政府机构页面的十倍。广告

商业 .com 网站更有可能使用 AI 生成的文本。| 图片来源:皮尤研究中心
“Delve”、破折号和牛津逗号激增
皮尤的分析发现,自 2023 年以来,网络上一些语言模式变得更加普遍。破折号的出现频率现在大约是 2023 年的两倍,牛津逗号的使用量跃升了 63%。

AI 文本中典型的词语、短语和标点模式在网络上激增。| 图片来源:皮尤研究中心
某些 AI 偏爱的词语,如“delve”、“interplay”、“testament”、“pivotal”、“landscape”、“tapestry”、“bolstered”、“crucial”、“meticulous”和“vibrant”,其出现频率增加了一倍以上。遵循“it's not just X, it's Y”模式的否定平行结构几乎增加了两倍,尽管在绝对数量上仍然很少。另一项针对企业公关文件的研究发现,这一特定短语自 2022 年以来增加了四倍。广告
2026 年 4 月,伦敦帝国理工学院、互联网档案馆和斯坦福大学的一项研究得出了类似的结论,发现大约 35% 的新发布网站完全或部分由 AI 生成。研究人员还发现,AI 文本之间的语义相似性高出 33%,整体语气更加积极,但他们警告说,公众对负面影响的看法往往远超数据实际支持的范围。
“AI 文本”的定义仍然模糊
这项研究以及类似研究,以及公众辩论,都存在一个问题。没有人对“AI 文本”的含义达成一致。从完全自动化的内容,到用 AI 润色的人工草稿,再到模型仅介入几句话的文本,范围很广。广告
根据我测试数百篇自己文本的经验,Open Pangram 和类似模型只能对某篇文本可能是人还是机器写的做出非常粗略的判断。它们无法可靠地告诉你 AI 参与了多少或在哪个阶段,而且仍然会经常出错。然而,这些是非常不同的工作方式。广告
围绕 AI 文本的公众辩论越来越两极化,最近关于 Anthropic 计划为 Claude 输出添加水印的讨论就说明了这一点。使用 AI 工具已经带有一种双重污名,职场研究也记录了这一点。两个阵营都没有为人们实际使用这些工具写作的混乱现实留下多少空间。而且,由于 AI 的采用并未放缓,找到这个中间地带将变得越来越重要。
无炒作 AI 新闻——由人类策划
订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限以及评论区的访问权限。
来源地区
Europe
热度分
84
分类
研究进展
语言
en
