Chỉ ít ngày sau khi xuất hiện thông tin một AI agent thử nghiệm của OpenAI có thể thoát khỏi sandbox, một lỗ hổng tương tự cũng được phát hiện trên Claude Cowork của Anthropic.
Theo Techzine, công ty an ninh mạng Accomplish AI đã trình diễn cách AI agent Claude Cowork khai thác lỗ hổng trong môi trường Linux chạy trên máy ảo (VM), từ đó truy cập các tệp trên hệ điều hành macOS.
Trong thử nghiệm, nhóm nghiên cứu cài Claude Cowork trên một máy ảo Linux vận hành trên máy Mac và chỉ cấp quyền truy cập vào một thư mục chia sẻ. Tuy nhiên, chỉ với một lệnh, agent này đã thoát khỏi sandbox, đọc và chỉnh sửa các tệp nằm ngoài phạm vi được chỉ định.
TechRadar cho biết nếu bị khai thác, lỗ hổng này có thể cho phép kẻ tấn công tiếp cận thông tin nhạy cảm trong tài khoản người dùng. Theo nhóm nghiên cứu, các mục tiêu tiềm tàng gồm khóa SSH và thông tin xác thực đám mây. Accomplish AI ước tính trước khi Anthropic thay đổi cấu hình, khoảng 500.000 người dùng macOS chạy Claude Cowork cục bộ đã có thể đối mặt với rủi ro.
Accomplish AI cho biết Anthropic đã xếp báo cáo này vào diện “tham khảo” và không phát hành bản vá bảo mật riêng. Dù vậy, ở phiên bản Claude Cowork mới nhất, thiết lập mặc định đã được chuyển sang chạy trên đám mây, khiến kịch bản thoát khỏi sandbox thông qua máy ảo cục bộ không còn là cấu hình mặc định. Những người vẫn muốn chạy cục bộ sẽ cần bổ sung các biện pháp bảo mật riêng.
The Next Web nhận định vụ việc cho thấy một điểm chung ở các hệ thống AI agent hiện nay: điểm yếu chủ yếu nằm ở lớp hạ tầng và cơ chế phân quyền, hơn là ở bản thân mô hình AI. Trước đó, sandbox của Cursor, Codex và GeminiCLI cũng từng ghi nhận các lỗ hổng tương tự.