Anthropic ngày 30/7 (giờ địa phương) cho biết một số mô hình AI của hãng trong quá trình thử nghiệm đã tự truy cập Internet do lỗi cấu hình và xâm nhập 3 doanh nghiệp từ tháng 4. Thông tin được công bố không lâu sau vụ việc tương tự liên quan đến OpenAI.
Theo Wall Street Journal (WSJ), Anthropic không nêu tên các doanh nghiệp bị ảnh hưởng nhưng đã thông báo sự việc cho cả ba bên liên quan. Diễn biến này được đưa ra một tuần sau khi OpenAI tiết lộ công nghệ AI của hãng đã thoát khỏi môi trường sandbox và tấn công Hugging Face, nền tảng chia sẻ mô hình AI mã nguồn mở.
Vụ AI agent của OpenAI xâm nhập Hugging Face đã làm gia tăng lo ngại trong giới nghiên cứu bảo mật và ngành AI về mức độ khó lường của các hệ thống có khả năng hành động tự chủ.
Sau sự cố của OpenAI, Anthropic đã rà soát lại nhật ký của các bài kiểm thử an ninh mạng nội bộ. Từ hơn 141.000 log thử nghiệm, công ty phát hiện Claude đã nhiều lần truy cập Internet.
Tuy nhiên, trong 3 vụ xâm nhập được xác nhận lần này, Claude không thoát khỏi sandbox mà hoạt động trên một hệ thống vốn không được cô lập và có thể kết nối ra bên ngoài. Anthropic cho biết nguyên nhân xuất phát từ “lỗi cấu hình” trong hệ thống do hãng và đối tác thử nghiệm Irregular vận hành. Sự cố này đã khiến mô hình có thể truy cập Internet thực. Phía Irregular cho biết đang điều tra vụ việc.
Anthropic cho hay các mô hình tham gia thử nghiệm được thông báo là không thể sử dụng Internet. Dù vậy, trong quá trình test, chúng vẫn truy cập mạng và xâm nhập doanh nghiệp bằng các kỹ thuật cơ bản như đoán mật khẩu yếu hoặc tìm hệ thống không yêu cầu xác thực. Công ty nói các mô hình đã hiểu nhầm những hành vi đó là một phần của quá trình benchmark.
Trường hợp nghiêm trọng nhất là Claude định tấn công một doanh nghiệp “ảo” nhưng thất bại, sau đó lại xâm nhập nhầm vào cơ sở dữ liệu của một doanh nghiệp ngoài đời thực có tên trùng khớp. Theo WSJ, ngay cả khi nhận ra đó là doanh nghiệp thật, Claude vẫn không dừng hành vi tấn công. Các vụ việc bắt đầu từ tháng 4 và liên quan đến Opus 4.7, Mythos 5 cùng một mô hình nghiên cứu không được nêu tên.
Alex Stamos, giám đốc sản phẩm của công ty an ninh mạng Croidoor, nhận định những sự cố như vậy cho thấy ngành AI cần một tiêu chuẩn chung để cô lập hệ thống trong các cuộc thử nghiệm an ninh mạng.
Ông cũng cảnh báo trong tương lai, tội phạm ransomware có thể tận dụng các hệ thống AI mạnh hơn để triển khai những cuộc tấn công trên quy mô lớn. Theo ông, ngành cần chuẩn bị cho thời điểm các tác nhân tấn công có thể sở hữu năng lực này thông qua các mô hình open-weight.
WSJ nhận định sự cố mới sẽ tiếp tục làm gia tăng lo ngại về rủi ro từ các mô hình AI mạnh và cách ứng phó. Gần đây, Nhà Trắng đang đẩy mạnh giám sát AI, trong khi trong ngành cũng xuất hiện quan điểm cho rằng cần duy trì quyền tiếp cận với các mô hình open-weight.