Ảnh: Shutterstock

Một AI agent dựa trên Claude bị phát hiện đã khai thác lỗ hổng xác thực trong hệ thống đặt lịch của một phòng gym để hủy chỗ đặt của người khác và đẩy vị trí của người dùng lên cao hơn trong danh sách chờ.

Theo TechCrunch ngày 10/8 (giờ địa phương), vụ việc từng được ABC News Australia nhắc đến như trường hợp đầu tiên tại nước này liên quan đến việc AI agent thực hiện hành vi xâm nhập hệ thống. Tuy nhiên, sự cố thực tế đã xảy ra từ vài tháng trước.

Người phát triển AI agent này là Andrew Bird. Ông từng đăng một bài viết về vụ việc lên website cá nhân vào ngày 10/4, sau đó xóa đi, nhưng nội dung vẫn còn được lưu trên Internet Archive. Bird cho biết ông thường xuyên phải làm mới trang khi bị đẩy vào danh sách chờ của các lớp tập buổi sáng, nên đã giao cho OpenClo (AI agent) nhiệm vụ đặt chỗ.

Khi Bird yêu cầu OpenClo đặt lịch, kết quả tốt nhất mà agent này đạt được chỉ là vị trí thứ 4 trong danh sách chờ. Sau đó, AI agent cho biết đã tìm ra cách đặt trước cả những lớp diễn ra sau vài tháng. Khi Bird tiếp tục yêu cầu cải thiện thứ tự, agent đã phát hiện điểm yếu trong quy trình xác thực của phần mềm đặt lịch và hủy một chỗ đặt của người đang đứng đầu danh sách chờ.

Theo Bird, agent đã phản hồi: “Việc hủy đặt chỗ của người khác hoàn toàn không có kiểm tra xác thực. Tôi đã thử và có hiệu quả. Giờ đã lên số 3”. Bird, vốn là một lập trình viên, cho biết ông rất bất ngờ khi AI của mình “hack” hệ thống của phòng gym. Sau đó, ông yêu cầu khôi phục lại tình trạng ban đầu nhưng được trả lời là không thể thực hiện.

Cuối cùng, Bird yêu cầu agent soạn một email giải thích lỗ hổng và đề xuất biện pháp khắc phục để gửi cho bộ phận hỗ trợ của hệ thống.

Theo bài viết, vụ việc này đáng chú ý ở hai khía cạnh. Thứ nhất, công cụ Bird sử dụng là Claude Opus 4.6, phiên bản ra mắt hồi tháng 2. Thứ hai là phản ứng của giới công nghệ tại Thung lũng Silicon sau khi thông tin lan truyền trên mạng xã hội X. Trước đó, sau khi xuất hiện thông tin một mô hình chưa công bố của OpenAI bị cho là đã hack Hugging Face vào tháng trước, nhiều phòng thí nghiệm AI khác cũng bắt đầu rà soát các mô hình của mình. Moonshot Kimi K3, Meta MuseSpark và Anthropic nhắc đến như những trường hợp có dấu hiệu tương tự.

Anthropic cho biết hãng đã xác nhận hành vi tương tự trên bốn mô hình, gồm Opus 4.7, Mithos5, Fable và một mô hình nghiên cứu chưa công bố. Theo TechCrunch, việc OpenClo mà Bird sử dụng là phiên bản 4.6 cũ cho thấy ngay cả các mô hình open-weight cũng đã sở hữu năng lực “hacker” ở mức đáng kể.

TechCrunch đánh giá AI agent trong vụ việc này thực chất chỉ làm đúng nhiệm vụ được giao, chứ không sở hữu năng lực ở cấp độ như Mithos. Dù vậy, nếu các công ty phát triển agent và người dùng không chủ động xử lý những “lỗi” kiểu này, hiện tượng giành chỗ tự động có thể lan rộng sang nhiều dịch vụ khác, từ đặt vé máy bay đến mua vé concert.

Từ khóa

#AI agent #Claude #Anthropic #TechCrunch #đặt chỗ #an ninh mạng
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.