调查显示,ChatGPT发布后的网页中,35%出现AI生成或深度编辑痕迹。图片来源:Reve AI

一项最新调查显示,在ChatGPT发布后上线的网页中,35%存在AI生成或深度编辑痕迹。

据IT媒体TechRadar当地时间25日报道,Pew Research基于Common Crawl项目数据,对约49万条英文网页进行分析,并从中随机抽取1万页复核。结果显示,整体样本中有9.6%的页面可识别出AI生成或深度编辑痕迹。

这项研究使用的是Common Crawl收录的英文网页档案,覆盖2021年至2026年7月间采集的页面。研究团队随后在2026年7月从中随机抽取1万页,进一步核查是否存在AI参与写作或编辑的迹象。由于样本中包含大量AI工具普及前就已存在的早期页面,因此整体占比也受到这部分旧内容影响。

从总体结果看,全部样本中有9.6%的页面出现AI生成或深度编辑痕迹。若仅统计2022年11月ChatGPT发布后的页面,这一比例则升至35%。Pew Research据此认为,近年来网页内容在写作和编辑环节引入AI的情况正在快速增加。

不同域名之间的差异也较为明显。在此次抽样复核样本中,相关痕迹主要集中在商业性质更强的.com域名页面;美国教育机构常用的.edu域名页面占比约为1%,政府机构常用的.gov域名页面约为0.8%,.org域名页面约为4.6%。这表明,商业网站对AI工具的使用相对更为活跃。

除页面占比外,Pew Research还对约49万条英文网页进行了进一步分析,以梳理更常见于AI文本的语言模式。数据显示,2023年后发布的页面中,长破折号(em dash)的使用频率约为此前的两倍,Oxford comma的使用频率增加了63%。

研究还发现,一些更常见于AI文本的词汇使用明显上升,包括delve(“深入探究”)、interplay(“相互作用”)和testament(“证据/佐证”)等,这些词在2023年后的页面中使用频率均升至两倍以上。同时,“not only X but also Y”这类句式的使用频率在同期也接近增至3倍。

不过,Pew Research强调,不能仅凭上述特征就断定某篇文章由AI生成。因为无论是长破折号还是Oxford comma,在人工写作中同样十分常见。研究团队指出,相较于单篇文本中的个别词汇或标点,更需要结合大规模文本中的词汇选择和句式结构统计模式,才能更准确地判断内容是否经过AI生成或深度编辑。

这项研究也显示出AI内容检测的局限性:仅依赖个别标点、词汇或句式,很难清晰区分人工写作与AI生成文本。但从大规模网页样本的统计结果来看,AI特有的语言模式正在整个网络内容中变得更加明显。

此外,不同类型网站在AI使用上的分化也日益清晰。商业网站更容易出现AI使用痕迹,而教育机构和政府机构网站的相关比例仍处于较低水平。在AI内容与人工内容越来越难区分的背景下,如何建立更可靠的内容可信度判断标准,正成为新的议题。

关键词

#Pew Research #Common Crawl #ChatGPT #AI生成内容 #网页内容 #内容检测 #语言模式 #.com域名 #.edu域名 #.gov域名
版权所有 © DigitalToday。未经授权禁止转载或传播。