OpenAI bắt đầu triển khai watermark ẩn đối với văn bản do ChatGPT và Codex tạo ra tại Liên minh châu Âu (EU), trong bối cảnh EU AI Act đã có hiệu lực từ ngày 2/8 và đặt ra yêu cầu minh bạch với nội dung do AI tạo sinh. TechCrunch đã đăng tải thông tin này ngày 5/10 theo giờ địa phương.
Theo kế hoạch, tính năng này sẽ được triển khai dần trong vài tuần tới cho người dùng ChatGPT và Codex tại EU, áp dụng trên tất cả các gói dịch vụ. Với các nhà phát triển sử dụng OpenAI API, từ ngày 5/10 họ có thể chủ động bật watermark trên một số mô hình ở mọi thị trường, song tính năng này hiện vẫn chưa được thiết lập mặc định trên toàn cầu.
Đây là dạng watermark không hiển thị trực tiếp. OpenAI cho biết hãng điều chỉnh nhẹ cách mô hình lựa chọn từ ngữ để tạo ra một mẫu tín hiệu mà người đọc không thể nhận biết bằng mắt thường, nhưng công cụ chuyên dụng vẫn có thể phát hiện. Vì watermark được gắn ngay trong nội dung văn bản, dấu hiệu này vẫn được giữ lại khi sao chép và dán.
OpenAI khẳng định công nghệ trên không nhằm nhận diện danh tính người dùng, đồng thời cho biết chưa ghi nhận tác động đáng kể tới hiệu năng mô hình sau khi kích hoạt tính năng.
Cùng với đó, OpenAI công bố báo cáo kỹ thuật về công nghệ “TextGrain”. Báo cáo được biên soạn với sự tham gia của các nhà nghiên cứu từ Đại học Pennsylvania và Đại học Yale, trong đó mô tả phương pháp sắp xếp các dự đoán về từ kế tiếp dựa trên một khóa bí mật. Theo OpenAI, khi những điều chỉnh nhỏ này được lặp lại hàng trăm lần, công cụ dò có thể phân biệt nội dung do AI tạo ra chỉ từ chính văn bản và khóa bí mật.
Tuy vậy, khả năng phát hiện có thể giảm khi nội dung bị chỉnh sửa. Trong thử nghiệm, khi 10% số từ được thay bằng từ đồng nghĩa, tỷ lệ phát hiện giảm từ khoảng 92% xuống 66%. OpenAI cũng cho biết các câu ngắn, câu trả lời toán học và văn bản đã được dịch là những trường hợp khó nhận diện hơn. Trước mắt, quyền truy cập công cụ dò chỉ được cấp cho các nhà nghiên cứu đã được phê duyệt và các tổ chức chuyên môn.
OpenAI lưu ý rằng việc không phát hiện watermark không đồng nghĩa văn bản đó do con người viết. Nguyên nhân có thể là nội dung quá ngắn, đã bị chỉnh sửa quá nhiều hoặc được tạo bởi AI của công ty khác. Công ty cũng cho biết watermark có thể cho thấy hệ thống của OpenAI đã tạo ra hoặc can thiệp vào một phần nội dung, nhưng không phản ánh được mức độ tham gia của con người trong các khâu như đánh giá, biên tập hay sáng tạo.
Động thái này được đưa ra hai tháng sau khi Anthropic thông báo sẽ áp dụng watermark cho văn bản do Claude tạo ra trên phạm vi toàn cầu.