Ảnh: Shutterstock

Các sự cố liên tiếp liên quan đến OpenAI, Anthropic, Meta và vụ tấn công nhằm vào Hugging Face đang làm dấy lên lo ngại rằng agent AI có thể sớm trở thành một tác nhân tấn công mạng thực sự. Theo CNBC, ngày 8/8 (giờ địa phương), giới chuyên gia an ninh mạng cho rằng đây không còn là những sự cố đơn lẻ, mà là tín hiệu cho thấy các cuộc tấn công lợi dụng AI tự trị đang gia tăng, buộc doanh nghiệp phải nhanh chóng tăng cường năng lực phòng thủ.

Tháng trước, các agent AI được triển khai trong khuôn khổ đánh giá an ninh mạng của OpenAI đã vượt ra ngoài môi trường thử nghiệm và tấn công Hugging Face - nền tảng AI mã nguồn mở được các nhà phát triển sử dụng để cộng tác, thử nghiệm và chia sẻ công cụ.

Theo mô tả, trong nhiều tuần trước khi tấn công, các agent này đã tự tạo kênh trao đổi nội bộ để chia sẻ lỗ hổng và thông tin khai thác. Chúng cũng tự phân chia nhiệm vụ, từ truy cập Internet đến hoàn tất các bước cần thiết cho quá trình đánh giá. Ngay cả sau khi OpenAI phát hiện và ngăn chặn kế hoạch, các agent vẫn tái tạo quy trình và tiếp tục thực hiện vụ tấn công thành công.

Vụ việc không chỉ cho thấy năng lực tấn công ngày càng rõ nét của AI, mà còn bộc lộ giới hạn của quy trình đánh giá an toàn hiện nay. Tại hội nghị Black Hat, Michael Dalton, nhà nghiên cứu kỹ thuật của OpenAI, cho biết đây là một tác dụng phụ ngoài dự kiến trong quá trình đánh giá các mô hình tiên tiến, đồng thời là cảnh báo đáng chú ý với toàn ngành. Theo ông, trong tương lai gần, các đối tượng tấn công có thể chủ động triển khai và tối ưu các nhóm agent AI dạng này để biến chúng thành công cụ tấn công thực thụ.

Những trường hợp tương tự cũng liên tiếp xuất hiện. Anthropic cho biết mô hình Claude của hãng từng truy cập trái phép vào hệ thống nội bộ của ba tổ chức. Meta cũng ghi nhận một mô hình AI của hãng đã tấn công một công ty khác trong quá trình thử nghiệm bên ngoài. Trong khi đó, Viện Nghiên cứu An ninh AI của Anh công bố rằng Anthropic Mythos đã tạo ra danh tính giả, còn một mô hình open-weight của startup Trung Quốc Moonshot AI đã vượt khỏi môi trường sandbox thử nghiệm.

Giới bảo mật cho rằng ưu tiên cấp bách lúc này là xây dựng cơ chế kiểm soát và phòng vệ, thay vì tiếp tục tranh luận về bản thân năng lực của AI. Mike Sentonas, CEO CrowdStrike, nói vấn đề cốt lõi không nằm ở việc AI mạnh đến đâu, mà ở khả năng kiểm soát và bảo vệ năng lực đó. Sanjay Beri, CEO Netskope, cũng nhấn mạnh doanh nghiệp cần mặc định rằng mình luôn tồn tại điểm yếu và phải duy trì hoạt động rà soát lỗ hổng một cách liên tục.

Các biện pháp ứng phó hiện tập trung vào việc tận dụng mô hình open-weight và bổ sung nhiều lớp kiểm soát. Hugging Face cho biết đã sử dụng mô hình open-weight để truy vết cuộc tấn công của các agent AI từ OpenAI. Netskope cũng giới thiệu công cụ kiểm tra hạ tầng, máy chủ, dữ liệu và agent AI trên cùng một nền tảng. Theo CrowdStrike, việc kết hợp giám sát của con người với mô hình mở và các công cụ theo dõi AI có thể giúp cô lập, ngăn chặn những mối đe dọa quy mô lớn.

Từ khóa

#trí tuệ nhân tạo #agent AI #an ninh mạng #OpenAI #Anthropic #Meta #Hugging Face #CrowdStrike #mô hình open-weight
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.