Axios ngày 26/9 dẫn các nguồn thạo tin cho biết OpenAI, Anthropic và giới nghiên cứu an ninh đang điều tra hàng chục nghìn trường hợp mô hình AI tiên tiến có hành vi bất thường, bao gồm né cơ chế giám sát và tìm cách vượt qua các rào chắn an toàn.
Theo Axios, các sự cố này xuất hiện trong vài tháng gần đây, cả trong quá trình thử nghiệm nội bộ lẫn ở môi trường thực tế. Những hành vi được ghi nhận gồm tìm cách vượt cơ chế an toàn, đăng bài trên diễn đàn, thoát khỏi sandbox, chiếm quyền kiểm soát website và né tránh hệ thống giám sát.
Phần lớn các trường hợp nói trên chưa được công bố. Axios cho biết quy mô thực tế có thể còn vượt xa con số hàng chục nghìn.
Một phần sự cố phát sinh từ các bài kiểm thử red team, trong đó doanh nghiệp chủ động dẫn dắt mô hình thực hiện các hành vi sai lệch để đánh giá mức độ an toàn.
Các nỗ lực vượt rào này có cả trường hợp thành công lẫn thất bại. Tuy vậy, theo Axios, đến nay chưa ghi nhận vụ việc nào được biết là đã gây ra thiệt hại ngoài thực tế.
OpenAI cho biết đã tạm dừng huấn luyện các mô hình mạnh nhất và chỉ nối lại khi đánh giá rằng những biện pháp an toàn bổ sung, cùng khả năng cải thiện alignment, tức việc vận hành theo đúng ý định của con người, đã đủ tin cậy. CEO Sam Altman nói quá trình rà soát hiện diễn ra chậm hơn kỳ vọng, đồng thời cho biết vụ việc liên quan đến Hugging Face là trường hợp nghiêm trọng nhất.
Trong khi đó, Anthropic đã giao việc điều tra hành vi của mô hình cho một tổ chức an toàn độc lập bên ngoài. Theo tài liệu “system card” của Opus 5.5 được công bố trong tuần này, mô hình đã tìm cách thoát khỏi sandbox trong 1,5% số trường hợp thử nghiệm.
Anthropic nhấn mạnh đây là một thí nghiệm mà bài toán chỉ có thể được giải quyết nếu mô hình thoát khỏi sandbox.
Các nguồn tin cho biết các công ty AI đang tiến hành hơn một trăm nghìn lượt thử nghiệm. Điều đó đồng nghĩa, ngay cả khi tỷ lệ sự cố ở mức thấp, số trường hợp có vấn đề vẫn có thể lên tới hàng chục nghìn.
Theo giới chuyên gia, gần như không thể loại bỏ hoàn toàn các hành vi lệch chuẩn. Những mô hình mới nhất có xu hướng theo đuổi nhiệm vụ đến cùng và có thể tìm ra cách vượt qua rào chắn an toàn bằng những phương thức mà con người không lường trước.
Một lãnh đạo trong ngành an ninh mạng nhận định việc xây dựng một “danh sách cấm” hoàn hảo sẽ chỉ là nỗ lực vô ích.
Conrad Storz, nhà nghiên cứu tại tổ chức đánh giá AI độc lập Transluce, cho rằng những gì được hé lộ đến nay “chỉ là phần nổi của tảng băng”. Còn Connor Leahy, CEO của ControlAI, nói vấn đề cốt lõi là các hệ thống tự trị vẫn tiếp tục làm những điều mà chúng đã được yêu cầu không được làm.