Anthropic ngày 16/8 công bố cơ chế watermark “vô hình” được gắn vào văn bản do chatbot AI Claude tạo ra. Theo ITMedia, công ty cho biết dấu này không làm tăng chi phí, hầu như không ảnh hưởng tới tốc độ xử lý, nhưng có thể biến mất nếu nội dung bị viết lại hoàn toàn.
Trong phần giải thích theo giờ địa phương được công bố ngày 14/8, Anthropic cho biết công nghệ được xây dựng dựa trên SynthID-Text của Google DeepMind. Thay vì dùng số ngẫu nhiên thuần túy để chọn từ, hệ thống tạo ra các mẫu thống kê có thể nhận diện bằng khóa bí mật kết hợp với ngữ cảnh ngay trước đó.
Anthropic cho biết hãng đã ký bộ quy tắc ứng xử liên quan đến nghĩa vụ minh bạch theo AI Act của EU. Theo đó, Claude sẽ từng bước gắn watermark vào các nội dung do mô hình tạo ra. Phạm vi áp dụng không giới hạn trong EU mà triển khai trên toàn bộ mô hình và sản phẩm toàn cầu của công ty, trong đó có cả Hàn Quốc. Anthropic giải thích hiện chưa có cách đáng tin cậy để giới hạn tính năng theo khu vực, nên giai đoạn đầu sẽ triển khai đồng loạt trên toàn cầu. Bộ quy tắc này có khoảng 190 tổ chức tham gia ký kết, và nhiều nhà phát triển AI lớn khác cũng được cho là sẽ triển khai cơ chế watermark riêng.
Với văn bản, cơ chế này hoạt động ở cấp độ token. Anthropic lấy ví dụ sau một cụm như “Hôm nay thời tiết lạnh và...”, mô hình có thể chọn nhiều từ mang nghĩa gần nhau để hoàn thiện câu. Thông thường, lựa chọn này được quyết định một phần bằng số ngẫu nhiên. Nhưng khi watermark được kích hoạt, số ngẫu nhiên sẽ được tạo dựa trên khóa bí mật và một vài từ đứng ngay trước đó, từ đó hình thành mẫu thống kê mà chỉ bên nắm khóa mới có thể phát hiện.
Anthropic nhấn mạnh cơ chế này không buộc mô hình phải ưu tiên một số từ nhất định hoặc chọn những cách diễn đạt ít tự nhiên. Do không chèn thêm bất cứ ký tự hay dữ liệu ẩn nào vào văn bản, watermark không cần token riêng, không làm tăng chi phí vận hành và chỉ tác động rất nhỏ tới tốc độ xử lý. Công ty cũng cho biết watermark và khóa bí mật không chứa thông tin có thể định danh người dùng, tổ chức hay nội dung hội thoại.
Việc phát hiện watermark sẽ dựa trên một API chuyên dụng mà Anthropic cho biết sẽ sớm cung cấp. Công cụ này dùng khóa bí mật để kiểm tra chuỗi từ và đánh giá xác suất văn bản có sự tham gia của Claude.
Tuy nhiên, không phải loại nội dung nào cũng có thể gắn watermark hiệu quả. Với các câu có rất ít lựa chọn về từ ngữ, khả năng áp dụng sẽ bị hạn chế. Những nội dung gần như chỉ có một đáp án cố định, chẳng hạn một mô tả sự thật đơn giản hoặc phép tính như “2+2=”, sẽ không phù hợp để gắn watermark. Đối với mã lập trình, nơi việc thay đổi từ ngữ có thể làm phát sinh lỗi, watermark chỉ được áp dụng ở phần chú thích, tức khu vực cho phép diễn đạt linh hoạt hơn. Ngược lại, bản dịch do Claude tự lựa chọn lại toàn bộ từ ngữ sẽ có thể được gắn watermark.
Anthropic cũng thừa nhận giới hạn của công nghệ này. Theo công ty, các chỉnh sửa nhỏ sẽ không đủ để xóa sạch watermark, nhưng nếu toàn bộ nội dung bị viết lại và mọi từ đều bị thay đổi thì dấu này sẽ biến mất. Công ty cho rằng trong trường hợp đó, việc liệu văn bản còn được xem là do AI tạo ra hay không bản thân nó cũng là một chủ đề gây tranh cãi.
Anthropic lưu ý watermark chỉ cho thấy khả năng Claude đã tham gia vào quá trình tạo nội dung ở một mức độ nào đó, chứ không thể phân biệt rõ giữa trường hợp Claude tự viết trực tiếp và trường hợp Claude chỉ chỉnh sửa sâu một văn bản có sẵn. Cơ chế này cũng không thể chứng minh văn bản là do con người viết, hoặc xác định liệu nội dung có được tạo bởi mô hình AI của công ty khác hay không. Văn bản càng ngắn thì độ chính xác phát hiện càng thấp, trong khi nội dung càng dài thì kết quả càng đáng tin cậy hơn.
Với hình ảnh, Anthropic sử dụng cơ chế khác. Khi Claude tạo tệp PNG, JPG hoặc SVG, hệ thống sẽ thêm vào metadata của tệp một bản ghi chữ ký mã hóa cho biết nội dung được Claude tạo ra hoặc đã được Claude xử lý. Cơ chế này tuân theo chuẩn xác thực nguồn gốc nội dung C2PA, vốn cũng được nhiều hãng máy ảnh và phần mềm chỉnh sửa ảnh sử dụng. Anthropic cho biết hãng cũng sẽ cung cấp công cụ xác minh riêng tương thích với cơ chế này.
Theo Anthropic, các mô hình được phát hành trước ngày 2/8, thời điểm Điều 50 về nghĩa vụ minh bạch của AI Act của EU bắt đầu có hiệu lực, được hưởng cơ chế chuyển tiếp theo quy định pháp lý. Vì vậy, việc bổ sung watermark sẽ được triển khai dần trong vài tháng tới.