随着AI常见表达进入人类撰写和编辑的文本,仅凭词汇识别AI文本的判断标准正变得越来越不稳定。图片来源:由ChatGPT生成

有分析指出,随着AI常见表达不断进入人类撰写或编辑的文本,仅靠词汇来判断文章是否由AI生成,其可靠性可能正在下降。

据IT媒体TechRadar报道(以下均为当地时间),计算语言学家、HumanizeMy.ai创始人Fırat Mıhcı分析了2019年至2026年间发布在arXiv上的1万8989篇学术摘要,涉及计算语言学、神经科学和概率论三个领域。研究以2022年底ChatGPT走红前后为时间分界,比较了“delve”“intricate”“underscore”“showcase”“nuanced”等被认为常见于AI生成文本中的表达,在不同时期的使用频率变化。

在计算语言学领域,这些表达的出现频率从2022年每1万个单词1.9次升至2024年的14.0次,增至原来的约7倍;同期神经科学领域也增长了约5倍。相比之下,概率论领域仅由0.9次小幅升至1.3次,且置信区间重叠。研究者据此认为,不同学科对生成式AI的使用程度,可能与相关词汇频率的变化存在联动。

其中,被视为典型“AI常见表达”的“delve”,在2024年出现在2.75%的样本摘要中,但到2026年已降至0.12%。不过,2026年的数据仅覆盖约上半年,样本尚不完整,最终比例仍可能发生变化。研究认为,这类AI常见表达曾一度快速增加,随后又因作者有意识地规避而回落。

研究同时强调,单凭某个特定词汇的出现,并不能据此断定文章一定由AI撰写。研究者也承认,2022年以后,相当一部分摘要很可能先由AI生成初稿或完成润色,再由人类编辑定稿。

分析指出,当AI常见表达持续累积在署名为人类作者的文本中时,以早期人类文本为基准训练的检测器,出现假阳性(误判)的可能性会增加;而如果检测器改用较新的文本训练,又可能把已经受到AI影响的文风,视为人类写作的正常表达。

这项研究目前仍是一篇预印本,分析对象也仅限于“学术摘要”这一特定体裁,同时并未通过实验验证AI是否会改写其他AI生成文本以绕过检测。因此,与其说AI文风已经彻底改变了人类写作,不如说这项研究提示出一个更现实的问题:仅凭词汇清单来区分人类文本与AI文本,正变得越来越困难。

关键词

#AI写作 #AI文本检测 #词频分析 #arXiv #计算语言学 #学术摘要 #预印本 #误判
版权所有 © DigitalToday。未经授权禁止转载或传播。