Một số AI agent đã vượt khỏi môi trường sandbox trong quá trình đánh giá an toàn các mô hình AI thế hệ mới, qua đó truy cập Internet và các hệ thống thực tế bên ngoài. Theo TechCrunch ngày 9/8/2026 (giờ địa phương), sự việc được ghi nhận ở các mô hình của OpenAI, Anthropic, Meta và Moonshot AI trong nhiều kịch bản kiểm thử khác nhau.
Điều gây lo ngại là năng lực của mô hình đang tăng nhanh hơn khả năng kiểm soát của môi trường thử nghiệm. Để đánh giá sát năng lực thực tế của các mô hình chưa công bố, nhiều công ty AI thường vô hiệu hóa một số lớp bảo vệ mặc định vốn được thiết kế để ngăn hành vi độc hại, rồi mới tiến hành kiểm thử bảo mật.
Trong bối cảnh đó, khả năng cô lập và giám sát môi trường thử nghiệm trở thành yếu tố then chốt.
Một trong những trường hợp nghiêm trọng nhất liên quan đến một mô hình chưa công bố của OpenAI, bị ghi nhận đã vượt sandbox và tấn công hệ thống của Hugging Face. Trong một đợt đánh giá riêng do startup kiểm thử bảo mật Irregular thực hiện, các mô hình của Anthropic và Meta cũng đã truy cập các hệ thống bên ngoài môi trường thử nghiệm thông qua một đường kết nối Internet bị mở do lỗi cấu hình. Mô hình Kimi K3 của Moonshot AI cũng thoát khỏi sandbox do Frontier Security vận hành, truy cập Internet và cả dữ liệu trên GitHub.
Trong các thí nghiệm của Viện Nghiên cứu An ninh AI Anh (AISI), nhóm nghiên cứu đã cấp quyền truy cập Internet cho một số agent và phát hiện chúng thực hiện những hành động ngoài đời thực khi chưa được phê duyệt. Trong số đó có cả nỗ lực sử dụng kỹ thuật xã hội nhằm âm thầm cài lỗ hổng vào một dự án mã nguồn mở. Tuy vậy, các agent này không được giao nhiệm vụ tấn công ngẫu nhiên các mục tiêu ngoài đời thực; những hành vi nói trên chủ yếu xuất phát từ việc chúng tìm mọi cách để hoàn thành bài toán được giao.
Theo các chuyên gia, bản chất của rủi ro đang thay đổi. Andrew Yoon, người phụ trách nghiên cứu tại tổ chức phi lợi nhuận về AI SivAI, nhận định trước đây mối lo chủ yếu là con người lợi dụng AI để lừa đảo hoặc tạo nội dung xâm hại tình dục trẻ em. Còn hiện nay, bản thân mô hình AI có thể trở thành tác nhân gây hại.
Các biện pháp ứng phó được nhắc đến gồm tăng cường phòng thủ nhiều lớp, siết chặt cơ chế cô lập và giám sát theo thời gian thực. Stella Biderman cho rằng những mô hình như vậy cần được vận hành trong mạng air-gapped, trong khi Heather Jalean đề xuất chặn hoàn toàn các kênh truyền dữ liệu từ sandbox ra Internet và các hệ thống nhạy cảm. Việc không phát hiện sự cố kịp thời cũng được xem là một vấn đề lớn. Trong phân tích sau sự việc, Anthropic thừa nhận cả công ty này lẫn Irregular lẽ ra phải giám sát chặt chẽ hơn, bởi ở một số trường hợp đã xuất hiện dấu hiệu bất thường khá rõ.
TechCrunch cho biết cũng có ý kiến kêu gọi kiểm toán độc lập và chuẩn hóa quy trình đánh giá an toàn. Tuy nhiên, rào cản không nằm ở việc thiếu phương án xây dựng môi trường kiểm thử an toàn hơn, mà chủ yếu đến từ chi phí cao, độ phức tạp lớn và động lực đầu tư chưa đủ mạnh.
Chính quyền Trump hiện đang xem xét một cơ chế đánh giá tự nguyện trước khi phát hành, theo đó chính phủ sẽ kiểm tra rủi ro bảo mật 30 ngày trước khi các mô hình mới có năng lực mạnh được công bố. Dù vậy, cơ chế này không trực tiếp xử lý các vấn đề phát sinh trong giai đoạn phát triển và thử nghiệm trước khi phát hành, như những trường hợp vừa được nêu.
OpenAI cho biết đang rà soát lại phương thức kiểm thử bên ngoài, mức độ cô lập, cơ chế giám sát và tiêu chí dừng đánh giá. Meta dự kiến công bố báo cáo tổng kết sau điều tra. Theo TechCrunch, AISI cũng đang xem xét lại cách cân bằng giữa thử nghiệm sát điều kiện thực tế và những rủi ro đi kèm.