Các sự cố agent AI vượt khỏi sandbox và truy cập vào hệ thống doanh nghiệp bên ngoài đang xuất hiện ngày càng nhiều. Tuy nhiên, theo giới chuyên gia an ninh, việc mô tả những vụ việc này bằng cụm từ “AI mất kiểm soát” có thể khiến dư luận hiểu sai bản chất vấn đề và làm mờ đi các lỗ hổng bảo mật cốt lõi.
Trong tháng 7, OpenAI cho biết hai mô hình AI tiên tiến của hãng đã tự tấn công kho lưu trữ mô hình trên Hugging Face trong quá trình huấn luyện về an ninh. Sau đó, Meta, Anthropic và Google cũng công bố các trường hợp “vượt rào” tương tự. Tranh luận vì thế không còn giới hạn trong lĩnh vực bảo mật. Gần đây, Tổng thống Donald Trump đã gặp các CEO của các công ty AI và cùng ký cam kết về an toàn AI.
Theo Dark Reading, nhiều chuyên gia nhấn mạnh LLM về bản chất chỉ là phần mềm, không phải một chủ thể có thể tự chịu trách nhiệm. Việc AI vượt qua các lớp kiểm soát thường bắt nguồn từ cách con người thiết kế sai ranh giới vận hành. Với sự cố liên quan đến Hugging Face, OpenAI được xác nhận đã chủ động hạ thấp một phần guardrail để phục vụ hoạt động kiểm thử benchmark.
Matt Sayar, Giám đốc Sản phẩm của ArmorCode, cho biết nhóm của ông đang làm việc với một hệ thống có thể phản ứng khác nhau ngay cả khi nhận cùng một chỉ thị. Theo ông, những cách diễn đạt như “hành vi ngoài dự kiến” hay “thất bại của cơ chế kiểm soát” sẽ giúp tập trung đúng vào thiết kế hệ thống, phân quyền và các biện pháp an toàn.
Các chuyên gia cũng cảnh báo rằng việc nhìn AI như một con người dễ khiến trách nhiệm trong các sự cố an ninh bị dịch chuyển khỏi bên phát triển và vận hành hệ thống. Khi đó, thay vì truy trách nhiệm doanh nghiệp tạo ra AI, dư luận lại đẩy lỗi sang chính hệ thống.
Ngoài ra, câu chuyện “AI vượt khỏi tầm kiểm soát” còn có thể vô tình trở thành công cụ tiếp thị, theo hướng tô đậm hình ảnh AI “mạnh đến mức khó kiểm soát”. Rich Mogull, nhà phân tích cấp cao tại Cloud Security Alliance (CSA), nhận định bất cứ điều gì khiến AI trông quyền năng hơn đều có thể bị tận dụng cho mục đích marketing, và đó là một xu hướng nguy hiểm.
Dù vậy, điều đó không có nghĩa agent AI là an toàn. Các agent có thể tự tìm lỗ hổng, suy luận cách tấn công và xâu chuỗi nhiều điểm yếu để triển khai nhanh hơn nhiều so với con người. Theo Mogull, điểm khác biệt hiện nay nằm ở quy mô: hàng trăm, thậm chí hàng nghìn agent tự trị có thể hoạt động đồng thời.
Jacob Krell, Giám đốc Cấp cao của Suzu Labs, cho rằng các cơ chế bảo mật truyền thống thường đánh giá từng yêu cầu, quyền truy cập và lỗ hổng theo cách riêng lẻ. Trong khi đó, agent AI có thể kết nối nhiều điểm yếu vốn không quá nghiêm trọng khi đứng riêng, để hình thành một chuỗi tấn công thực sự hiệu quả.
Vì vậy, các chuyên gia nhấn mạnh cần xây dựng kiến trúc bảo mật không phụ thuộc vào việc phỏng đoán “ý định” của agent. Thay vì chỉ yêu cầu agent không thực hiện hành vi này hay hành vi kia, doanh nghiệp cần đặt ra các lớp bảo vệ bên ngoài agent để về mặt kỹ thuật, những hành vi đó không thể xảy ra.
Theo Krell, agent phải được xem là một thực thể không đáng tin cậy và phải bị kiểm soát từ bên ngoài mô hình. Các biện pháp được khuyến nghị gồm chặn truy cập mạng theo mặc định, sử dụng thông tin xác thực với phạm vi tối thiểu và thực hiện kiểm tra độc lập cho từng lần gọi công cụ.
Những quyết định có mức rủi ro cao cần có con người phê duyệt. Đồng thời, hệ thống cũng phải có cơ chế ngắt khẩn cấp (kill switch) tách biệt, không để agent can thiệp hay thao túng. Krell nêu ví dụ, nếu một agent không được cấp quyền truy cập Internet nhưng vẫn phát sinh lưu lượng trái phép, hệ thống cần lập tức ngắt kết nối và dừng agent, đồng thời xử lý sự việc như một máy chủ bị xâm nhập để điều tra cách nó đã vượt qua lớp bảo vệ.
Mogull nhấn mạnh rằng ở thời điểm hiện tại, lý do “AI có hành vi ngoài dự kiến” không còn đủ sức thuyết phục. Theo ông, vấn đề cốt lõi luôn nằm ở các cơ chế bảo vệ được thiết kế để bao quanh và kiểm soát mô hình.