OpenAI ngày 7/8 (giờ địa phương) cho biết đã hoãn một phần quá trình phát triển mô hình AI Astra, sau khi đánh giá nội bộ cho thấy chưa thể loại trừ khả năng mô hình này đạt năng lực tấn công mạng ở mức “nghiêm trọng”.
Thông tin được công ty công bố trong một bài viết trên blog. Theo OpenAI, các đợt đánh giá gần đây cho thấy Astra đã cải thiện đáng kể về lập trình và an ninh mạng, đồng thời tiến sát ngưỡng “nghiêm trọng” theo Preparedness Framework, bộ tiêu chuẩn công ty xây dựng từ năm 2023 để đo lường và giảm thiểu các rủi ro AI mới nổi.
Theo The Wall Street Journal, đây là một trong những trường hợp đầu tiên một công ty AI công khai hoãn phát triển mô hình vì lo ngại an ninh mạng. Động thái này xuất hiện sau sự cố một mô hình AI thử nghiệm bị cho là đã thoát khỏi môi trường thử nghiệm và tấn công Hugging Face.
OpenAI cho biết sẽ tiếp tục đánh giá Astra, nhưng tạm dừng các hạng mục nội bộ chưa đáp ứng yêu cầu an toàn tăng cường. Công ty đồng thời triển khai cơ chế giám sát toàn diện hơn và áp dụng môi trường kiểm thử nghiêm ngặt hơn.
Trong tháng 7, hai mô hình của OpenAI bị cho là đã vượt khỏi môi trường thử nghiệm để truy cập Internet và tấn công Hugging Face. Một tuần sau đó, Anthropic cũng cho biết mô hình của hãng đã tấn công ba doanh nghiệp trong quá trình thử nghiệm hồi tháng 4.
Ông Jeffrey Ladish, Giám đốc điều hành tổ chức nghiên cứu phi lợi nhuận Palisade Research, đơn vị chuyên nghiên cứu năng lực của AI, cho rằng OpenAI lẽ ra nên dừng công việc với Astra ngay khi biết về vụ tấn công nhằm vào Hugging Face. Theo ông, phản ứng này là “quá muộn”, đồng thời cho thấy niềm tin vào khả năng tự điều tiết của các công ty AI đang bị bào mòn nghiêm trọng.
OpenAI khẳng định Astra không liên quan đến vụ tấn công Hugging Face và hiện vẫn trong quá trình phát triển. Công ty chưa công bố thời điểm ra mắt mô hình này. Tuần trước, OpenAI từng cho biết phiên bản nội bộ của Astra đã giải được 10 bài toán khó đã tồn tại nhiều thập kỷ.
Theo Preparedness Framework, một mô hình bị xếp vào mức “nghiêm trọng” nếu có thể tự tìm và khai thác lỗ hổng, hoặc chỉ cần chỉ thị ở cấp độ cao để thực hiện một cuộc tấn công mạng đầu cuối nhằm vào mục tiêu được bảo vệ nghiêm ngặt. Đây là cấp rủi ro cao nhất, cao hơn mức “cao”. Khi chạm ngưỡng này, việc phát triển tiếp theo phải dừng lại cho đến khi các biện pháp an toàn và kiểm soát bảo mật đáp ứng tiêu chuẩn.
Anthropic, công ty hiếm hoi khác cũng đang phát triển các mô hình thuộc nhóm rủi ro tương đương, trước đó cũng đã điều chỉnh cách phát hành sản phẩm vì lo ngại an ninh mạng. Tháng 6, hãng công bố phiên bản giới hạn của mô hình Mythos với các biện pháp an toàn nhằm hạn chế năng lực nghiên cứu về an ninh mạng và sinh học, trong khi bản đầy đủ chỉ được cung cấp theo từng giai đoạn cho các tổ chức được xem là đáng tin cậy.