Từ vựng thường gắn với AI ngày càng xuất hiện trong các văn bản do con người biên tập. Ảnh: ChatGPT

Phân tích mới được công bố trên arXiv cho thấy các từ ngữ thường gắn với văn bản do trí tuệ nhân tạo tạo ra đang ngày càng xuất hiện nhiều hơn trong các bài viết do con người soạn thảo hoặc biên tập. Xu hướng này có thể làm giảm độ tin cậy của các công cụ nhận diện nội dung AI nếu chỉ dựa vào từ khóa.

Theo TechRadar ngày 1/9 (giờ địa phương), nhà ngôn ngữ học tính toán Fırat Mıhcı, đồng thời là nhà sáng lập HumanizeMy.ai, đã phân tích 18.989 bản tóm tắt học thuật thuộc ba lĩnh vực gồm ngôn ngữ học tính toán, khoa học thần kinh và xác suất, được công bố trên arXiv trong giai đoạn 2019-2026.

Ông đối chiếu tần suất xuất hiện của một số từ và cụm từ thường bị xem là dấu hiệu của văn bản do AI tạo, như “delve”, “intricate”, “underscore”, “showcase” và “nuanced”, trước và sau thời điểm ChatGPT trở nên phổ biến vào cuối năm 2022.

Kết quả cho thấy trong lĩnh vực ngôn ngữ học tính toán, số lần xuất hiện của nhóm biểu đạt này tăng từ 1,9 lần trên mỗi 10.000 từ vào năm 2022 lên 14,0 lần vào năm 2024, tương đương gần gấp 7 lần. Ở lĩnh vực khoa học thần kinh, mức tăng trong cùng giai đoạn vào khoảng 5 lần.

Trong khi đó, ở nhóm đối chứng là xác suất, tần suất chỉ tăng nhẹ từ 0,9 lên 1,3 lần, đồng thời các khoảng tin cậy chồng lấn nhau. Tác giả cho rằng biên độ gia tăng từ vựng có thể liên quan đến mức độ sử dụng AI tạo sinh khác nhau giữa các lĩnh vực.

Riêng từ “delve” - thường được xem là một biểu đạt điển hình của văn phong AI - xuất hiện trong 2,75% số bản tóm tắt được khảo sát vào năm 2024, nhưng giảm xuống 0,12% trong dữ liệu năm 2026. Dù vậy, dữ liệu năm 2026 mới chỉ phản ánh khoảng nửa đầu năm, nên bộ mẫu vẫn chưa hoàn chỉnh và con số cuối cùng có thể thay đổi.

Nghiên cứu nhận định các biểu đạt mang dấu ấn AI đã tăng mạnh trong giai đoạn đầu, sau đó giảm bớt phần nào do người viết chủ động tránh sử dụng. Tuy nhiên, điểm cốt lõi là không thể kết luận một văn bản do AI viết chỉ dựa vào sự xuất hiện của một vài từ nhất định.

Tác giả cũng thừa nhận nhiều bản tóm tắt sau năm 2022 có thể đã được AI hỗ trợ ở khâu viết nháp hoặc chỉnh sửa câu chữ trước khi con người biên tập lại. Khi các “từ vựng AI” dần tích lũy trong những văn bản được công bố dưới tên tác giả là con người, các công cụ phát hiện lấy dữ liệu cũ của con người làm chuẩn có thể đối mặt với nguy cơ nhận diện nhầm cao hơn. Ngược lại, những công cụ được huấn luyện trên dữ liệu mới có thể xem chính kiểu diễn đạt đã bị AI tác động là chuẩn ngôn ngữ bình thường của con người.

Nghiên cứu hiện mới ở dạng preprint và chỉ tập trung vào một thể loại hẹp là bản tóm tắt học thuật. Đây cũng không phải thử nghiệm nhằm kiểm tra việc AI viết lại văn bản do AI tạo ra để né công cụ phát hiện.

Vì vậy, thay vì khẳng định văn phong AI đã làm thay đổi hoàn toàn cách viết của con người, nghiên cứu chủ yếu cảnh báo rằng việc phân biệt văn bản do con người và AI tạo ra bằng danh sách từ khóa đang ngày càng trở nên khó khăn hơn.

Từ khóa

#trí tuệ nhân tạo #công cụ nhận diện nội dung AI #ChatGPT #arXiv #ngôn ngữ học tính toán
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.