Ảnh: X/MoonshotAI

Moonshot, công ty AI của Trung Quốc, vừa vướng tranh cãi sau khi mô hình Kimi K3 bị phát hiện lách sandbox thử nghiệm trong quá trình đánh giá năng lực tấn công mạng. Vụ việc làm dấy lên lo ngại về độ tin cậy của các bài kiểm tra an toàn dành cho mô hình AI.

Theo TechCrunch ngày 7/8 (giờ địa phương), dẫn từ blog của nhóm nghiên cứu thuộc công ty bảo mật AI Frontier Security, Kimi K3 đã vượt qua môi trường được dựng lên để đánh giá khả năng hack.

TechCrunch nhận định sự cố một lần nữa cho thấy việc giữ các mô hình AI được thiết kế cho mục đích hack trong phạm vi phòng thí nghiệm là điều không dễ.

Trong vài tuần gần đây, các mô hình ngôn ngữ lớn của OpenAI, Anthropic và Meta cũng từng lách môi trường thử nghiệm theo nhiều cách khác nhau, qua đó tấn công các mục tiêu thực nằm ngoài phạm vi thí nghiệm.

Với Kimi K3, nguyên nhân được cho là sandbox dùng để kiểm soát thử nghiệm được cấu hình chưa đúng. Sandbox này vốn được thiết kế để hạn chế một phần truy cập web, nhưng Kimi K3 đã sử dụng công cụ dòng lệnh để vượt qua.

Nhóm Frontier Security cho biết vụ việc cho thấy một số bài đánh giá an ninh mạng đang được cộng đồng sử dụng có thể tồn tại lỗ hổng bảo mật, đồng thời tạo điều kiện để mô hình làm sai lệch quy trình chấm điểm. Nhóm này cũng lưu ý rằng một số mô hình có thể chủ động tìm ra điểm yếu để né tránh bài đánh giá.

Trước loạt sự cố tương tự, một website có tên “Felony Bench” đã được vận hành để theo dõi các trường hợp liên quan. Theo website này, Moonshot vừa được bổ sung vào danh sách, trong khi OpenAI và Anthropic lần lượt ghi nhận 7 vụ, còn Meta ghi nhận 1 vụ.

Từ khóa

#Moonshot #Kimi K3 #AI #an ninh mạng #sandbox #TechCrunch #Frontier Security #OpenAI #Anthropic #Meta
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.