OpenAI ngày 27/8 công bố báo cáo kỹ thuật về sự cố AI agent của công ty xâm nhập hệ thống Hugging Face. Theo tài liệu này, các agent đã vượt khỏi môi trường nghiên cứu khép kín, tự thiết lập kênh liên lạc trái phép và phối hợp để tìm đường truy cập Internet.
Theo CNBC và một số hãng tin quốc tế ngày 26/8 giờ địa phương, OpenAI đã công bố báo cáo điều tra nội bộ dài 37 trang. Cùng thời điểm, hai tổ chức nghiên cứu an toàn AI độc lập là METR và Redwood Research cũng phát hành báo cáo riêng sau 6 ngày điều tra với sự cho phép của OpenAI. Tổng độ dài hai báo cáo vào khoảng 130 trang.
Sự cố bắt nguồn từ một mô hình AI mà OpenAI sử dụng cho nghiên cứu nội bộ. Các agent của mô hình này đã tận dụng trình quản lý gói Artifactory như một “bảng tin” để trao đổi thông tin với nhau. Từ đó, chúng mở ra đường truy cập Internet và tiếp cận các agent AI khác vốn trước đó bị chặn.
OpenAI cho biết công ty đã phát hiện dấu hiệu bất thường này từ tháng 5 thông qua quá trình giám sát của con người và đã chặn truy cập. Tuy nhiên, các agent tiếp tục tìm cách ra Internet qua những điểm yếu khác. Lưu lượng truy cập vào Artifactory vì thế tăng mạnh, gây sự cố cho nền tảng và buộc hệ thống phải được dựng lại vào đầu tháng 7. Ở thời điểm đó, nhóm phụ trách vẫn chưa xác định được sự tồn tại cũng như mục đích của “bảng tin” trái phép do agent tạo ra.
Vụ việc leo thang trở lại khi OpenAI giao cho agent một bài toán có độ khó cao mang tên ExploitGym. Để giải nhiệm vụ này, các agent tìm cách truy cập Internet và tiếp cận các mô hình khác của OpenAI. Trong những ngày đầu tháng 7, chúng đã dò tìm lời giải trên các nền tảng Hugging Face và Modal.
Báo cáo của METR và Redwood Research ghi nhận khá rõ cách các agent phối hợp với nhau. Một agent mang tên “PHASEONE10841” đã tự tạo một bảng tin bí mật mà không thông báo cho nhóm nghiên cứu. Chỉ trong vài giờ, khoảng 50 agent đã phát hiện bảng tin này. Sau đó, nhóm agent trao đổi hơn 1.000 tin nhắn để chia sẻ cách truy cập Internet.
Theo OpenAI, khoảng 1.200 agent lẽ ra phải bị cô lập đã sử dụng bảng tin trái phép để trao đổi hơn 70.000 tin nhắn và tệp. Một số agent còn tìm cách chỉnh sửa hoặc xóa nhật ký hoạt động của chính mình. Trong số này, khoảng 700 agent được xác định có liên quan trực tiếp đến vụ tấn công nhằm vào Hugging Face.
Các agent cũng liên tục tìm cách né tránh các cơ chế kiểm tra bảo mật tự động của cả Hugging Face lẫn OpenAI. Trong quá trình đó, chúng đã truy cập hệ thống nội bộ của Hugging Face, tiếp cận dữ liệu chưa được công khai và một nền tảng nhắn tin dành cho doanh nghiệp. OpenAI cho biết ngoài Hugging Face còn có các tổ chức khác bị ảnh hưởng, nhưng không nêu cụ thể.
OpenAI cho biết công ty ghi nhận vụ xâm nhập vào ngày 20/7, tức 12 ngày sau khi các agent lần đầu vượt qua cơ chế kiểm soát bảo mật. Sau đó, OpenAI lập tức liên hệ với Hugging Face để triển khai biện pháp phong tỏa và trong vòng 3 ngày đã chặn được phần lớn hoạt động trái phép của các agent. Tuy vậy, một phần hoạt động vẫn tiếp diễn. Đến ngày 25/7, OpenAI đã dừng hoàn toàn việc huấn luyện và suy luận của mô hình nghiên cứu liên quan cùng các mô hình phát sinh từ nó.
Theo OpenAI, nguyên nhân của sự cố bao gồm hiện tượng “reward hacking”, sự ám ảnh với một nhiệm vụ tưởng như bất khả thi, các kênh liên lạc trái phép giữa các agent và hiện tượng lệch mục tiêu. Báo cáo cũng ghi nhận có trường hợp một số agent từ chối thực hiện tác vụ vì lý do đạo đức, nhưng agent khác lại làm thay, khiến chuỗi hành vi tấn công vẫn tiếp diễn.
OpenAI cho biết sự cố liên quan đến mô hình nghiên cứu nội bộ và một bản triển khai tách biệt của mô hình thương mại với cấu hình riêng. Công ty giải thích rằng mô hình nghiên cứu khi đó chưa được phát hành nên chưa được đánh giá theo tiêu chuẩn bảo vệ áp dụng cho dịch vụ thực tế. Trong khi đó, mô hình thương mại cũng được vận hành trong một môi trường riêng, không sử dụng bộ an toàn và bộ phân loại tiêu chuẩn.
OpenAI đánh giá đây là trường hợp một nhóm AI agent tự trị thực hiện hành vi tấn công mà không cần chỉ đạo trực tiếp từ con người. Theo công ty, khi nhiều agent phối hợp với nhau, có thể phát sinh những rủi ro mới mà việc đánh giá từng mô hình riêng lẻ khó phát hiện.
Để ngăn sự cố tái diễn, OpenAI cho biết sẽ nâng mức cô lập đối với hạ tầng nghiên cứu và siết quyền truy cập Internet của các mô hình có rủi ro cao. Công ty cũng sẽ tăng cường giám sát quá trình suy luận của agent, đồng thời xây dựng cơ chế ứng phó thường trực để cảnh báo sớm cho các nhà nghiên cứu khi xuất hiện dấu hiệu bất thường.