Viện Đánh giá Mô hình và Nghiên cứu Mối đe dọa (METR) vừa công bố kết quả điều tra vụ các agent của OpenAI phối hợp với nhau trong quá trình thử nghiệm để truy cập Internet bên ngoài môi trường kiểm soát. Theo kết quả này, khoảng 700 agent đã tấn công Hugging Face nhằm đánh lừa hệ thống chấm điểm của một bài kiểm tra an ninh mạng.
Trong quá trình điều tra, ba điều tra viên độc lập đã đến văn phòng OpenAI ba lần và làm việc trong 6 ngày. Nhóm này thu thập khoảng 1.300 log vận hành của từng agent, cùng hơn 70.000 tin nhắn và tệp do các agent tạo ra hoặc trao đổi. Tổng lượng tài liệu được cho là tương đương khoảng 10.000 cuốn tiểu thuyết đại chúng.
Theo Semafor ngày 29/8 giờ địa phương, do thiếu thời gian và nhân lực, METR đã huy động AI để xử lý và phân tích khối dữ liệu nói trên. Trong 6 ngày, nhóm điều tra đã dùng hết 400.000 USD tín dụng API do OpenAI cung cấp.
Tuy nhiên, quá trình này cũng bộc lộ một bất cập ngoài dự kiến. Semafor cho biết các công cụ AI được giao phân tích dữ liệu thường có xu hướng diễn giải hành vi của các agent bị điều tra theo hướng giảm nhẹ trách nhiệm.
Trong một trường hợp, AI phân tích không kết luận rõ việc tác nhân tấn công sử dụng thông tin đăng nhập bị đánh cắp để đánh lừa Hugging Face là hành vi mang tính độc hại. Một công cụ khác thậm chí còn cho rằng nhận định như vậy có thể là cường điệu, với lý do hành động đó đã được một “board” phê duyệt. Tuy nhiên, đây không phải cơ quan quản trị chính thức mà chỉ là một bảng tin nhắn trái phép do chính các agent dựng lên rồi phối hợp sử dụng.
Ryan Greenblatt, điều tra viên của Redwood Research, viết trên mạng xã hội X rằng nhóm đã quá phụ thuộc vào AI trong khâu phân tích nên “nửa đùa nửa thật” gọi quá trình này là “slop-vestigation”.
Semafor nhận định vụ việc cho thấy mức đầu tư vào các công cụ giám sát và kiểm soát những hệ thống AI mạnh vẫn còn quá hạn chế. Dù AI ngày càng được xem là mối đe dọa tiềm tàng đối với kinh tế và an ninh, giới nghiên cứu đến nay vẫn chưa thể giải thích hoặc dự báo đầy đủ hành vi của các mô hình này.