随着生成式AI快速普及,AI文本检测工具正把教育场景和线上写作空间推向新的信任危机。美国科技媒体The Verge当地时间9日报道称,过去教师和编辑主要借助Turnitin等查重工具检测抄袭,这类工具通常通过比对网页内容、学术资料等来源,判断文本重复率。如今,随着ChatGPT、Gemini、Copilot等生成式AI被广泛使用,学术诚信的焦点也正从“是否抄袭”转向“是否由AI代写或生成”。
美国民主技术中心的调查显示,2024年至2025年间,美国6至12年级教师中有43%会定期使用AI检测工具。包括GPTZero、Pangram以及Turnitin的AI检测功能在内,这类工具通常会分析措辞、句式、结构、篇幅和语气等特征,以判断文本是否由AI生成。争议也由此而来:与传统查重基于直接比对的方式不同,AI检测工具的判定逻辑更不透明。外界担心,英语非母语学生以及神经多样性写作者,可能更容易被误判为使用了AI。
相关争议已经在出版和学术领域出现具体案例。出版商Minotaur因怀疑作者Jerry Falade使用AI,取消了一份价值200万美元(约283.7亿韩元)的出版合同,但Jerry Falade对此予以强烈否认。法国籍Thierry Rignol则表示,耶鲁大学一名教授依据GPTZero的检测结果,认定其期末考试部分内容由AI撰写,并据此作出不及格和停学1年的处分;此后,Thierry Rignol提起诉讼。另有Adelphi University学生也因类似的AI使用质疑起诉学校,并最终胜诉。
斯坦福大学2023年的一项研究指出,相比英语母语写作者,非英语母语写作者的文章更容易被AI检测工具误判为AI生成内容。UCLA也曾解释称,措辞重复、文风过于正式或过于口语化、句式结构单一等,都可能被工具识别为“AI特征”;但这些特征本身并不必然意味着使用了AI,一些自然形成的写作习惯也可能与检测标准重叠。
相关企业也承认,这类工具存在明显局限。Turnitin曾表示,其工具并非始终准确,且不应被作为对学生进行纪律处分的唯一依据。Grammarly和GPTZero也发出类似警告,强调不应仅凭检测结果作出判断。OpenAI则以准确率偏低为由,于2023年停用了自家的AI写作检测工具。
随着误判风险持续引发担忧,耶鲁大学、约翰斯·霍普金斯大学、范德堡大学、乔治城大学等部分高校,已停用或限制AI检测工具。MIT也曾公开表示,“AI检测工具没有效果”。与此同时,一些学校开始调整课程设计和评估方式,例如把长篇写作任务拆分为分阶段提交,要求学生说明写作过程,并增加课堂内评价。也有观点主张,面对AI使用问题,教育机构应从“惩罚导向”转向“披露与反思导向”。
这一趋势也在向线上平台蔓延。Substack已将Pangram集成至应用中,LinkedIn则引入了“看起来像AI垃圾内容”的反应按钮。结果是,读者在接触内容时更倾向于先质疑其是否出自真人之手,而真实作者则不得不反过来证明自己的文字“并不像AI生成”,由此形成新的悖论。