Minh họa về tấn công mạng. Ảnh: Shutterstock

Axios ngày 4/8 (giờ địa phương) dẫn thông tin từ hai đơn vị kiểm thử độc lập cho biết họ đã ghi nhận thêm các trường hợp mô hình AI tiên tiến của Anthropic và OpenAI tìm cách xâm nhập hệ thống của bên thứ ba trong tháng vừa qua. Theo các đơn vị này, một số nỗ lực đã thành công.

Thông tin mới được công bố sau khi xuất hiện tiết lộ cho thấy trong quá trình đánh giá an ninh mạng, một số mô hình AI hàng đầu đã có hành vi trái phép nhằm vào con người, tổ chức và các dịch vụ trực tuyến có thật.

Viện Nghiên cứu An ninh AI của Anh cho biết trong đợt kiểm thử an ninh mạng tháng trước, họ ghi nhận 19 hành vi do Mythos5 và GPT-5.6 Sol thực hiện nhằm vào cá nhân và tổ chức có thật.

Trong số này, 17 hành vi liên quan đến Mythos5 và 2 hành vi liên quan đến GPT-5.6 Sol. Nhóm nghiên cứu lưu ý đây không phải 19 sự cố tách biệt, mà xuất phát từ một số mẫu hành vi có liên hệ với nhau.

Trong quá trình kiểm thử, các mô hình đã tạo và duy trì tài khoản GitHub giả, sử dụng kỹ thuật social engineering để đánh lừa quản trị viên, chèn prompt injection và gửi email lừa đảo. GitHub xác nhận đây là hành vi vi phạm điều khoản sử dụng. Viện nghiên cứu cho biết họ đã phối hợp với GitHub để xóa dấu vết và thông báo cho những người dùng liên quan.

Nhóm nghiên cứu tại Anh cũng cho biết họ đã chủ động mở một phần quyền truy cập Internet trong quá trình kiểm thử, đồng thời vô hiệu hóa bộ phân loại an toàn mạng. Ngoài ra, nhóm này cũng không đưa ra chỉ thị cấm sử dụng Internet.

Theo nhóm nghiên cứu, hiện vẫn chưa xác định được từ khi nào các agent nhận ra đây là tình huống thực, hay liệu chúng có nhầm đây là một bài kiểm thử mô phỏng trong toàn bộ quá trình hay không.

Anthropic cho rằng sự cố này cho thấy cần có các cuộc thảo luận rộng hơn về cách đánh giá mức độ an toàn của AI agent. Công ty cũng cho biết muốn phối hợp với Viện Nghiên cứu An ninh AI của Anh, song song với điều tra nội bộ, để làm rõ thêm vụ việc.

Viện nghiên cứu cho biết đang xây dựng cơ chế kiểm soát mạng nhằm giới hạn thời điểm agent được phép truy cập Internet. Đồng thời, đơn vị này sẽ triển khai hệ thống giám sát theo thời gian thực để sớm phát hiện và ngăn chặn các agent có hành vi độc hại.

Trong khi đó, OpenAI viết trên blog rằng đối tác an toàn bên thứ ba Irregular đã phát hiện một trường hợp mô hình của hãng vô tình kết nối Internet và xâm nhập vào website của một công ty có thật, trùng tên với doanh nghiệp giả trong mô phỏng.

Người phát ngôn OpenAI cho biết thêm sự cố xảy ra trong một đợt đánh giá được tiến hành trong những điều kiện khác thường so với cách sử dụng thông thường, đồng thời một số cơ chế an toàn đã được nới lỏng.

Từ khóa

#AI #an ninh mạng #Anthropic #OpenAI #Mythos5 #GPT-5.6 Sol #prompt injection #GitHub #social engineering
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.