Từ trái sang: Giáo sư Kim Jun-mo và nghiên cứu sinh tiến sĩ Kwon Min-chan. Ảnh: KAIST

KAIST ngày 30/7 cho biết nhóm nghiên cứu do giáo sư Kim Jun-mo, Khoa Kỹ thuật Điện và Điện tử, dẫn dắt đã phát triển Stable-GFlowNet, một khung red teaming mới cho mô hình ngôn ngữ lớn (LLM). Theo KAIST, công nghệ này có thể phát hiện 134 kiểu tấn công riêng biệt, nhiều hơn khoảng 7 lần so với công nghệ trước đó, trong khi vẫn duy trì tỷ lệ tấn công thành công ở mức 92%.

Trong red teaming AI, các nhà nghiên cứu tạo ra những prompt tấn công để buộc mô hình sinh phản hồi độc hại hoặc nguy hiểm trước khi đưa vào vận hành thực tế, từ đó rà soát các lỗ hổng an toàn. Bên cạnh tỷ lệ tấn công thành công, khả năng phát hiện được nhiều nhóm lỗ hổng khác nhau cũng là một chỉ số quan trọng.

KAIST cho biết các phương pháp dựa trên học tăng cường trước đây thường gặp hạn chế do hiện tượng “sụp đổ chế độ”, tức hệ thống chỉ lặp lại một số kiểu tấn công có xác suất thành công cao, làm giảm khả năng khai thác đa dạng lỗ hổng. GFlowNet từng được đề xuất như một giải pháp để tạo ra đầu ra đa dạng hơn, nhưng quá trình huấn luyện phức tạp, thiếu ổn định và có xu hướng đánh giá cao cả những câu truy vấn vô nghĩa.

Để khắc phục vấn đề này, nhóm nghiên cứu đã đưa vào kỹ thuật “cân bằng quỹ đạo đối chiếu”, cho phép ổn định quá trình huấn luyện bằng cách so sánh tương quan chất lượng giữa các đầu ra. Nhóm cũng áp dụng “cắt tỉa gradient nhiễu” nhằm loại bỏ dữ liệu có chênh lệch phần thưởng không đáng kể, đồng thời sử dụng “bộ ổn định độ trôi chảy tối thiểu-K” để sàng lọc các câu thiếu tự nhiên.

Trong thử nghiệm, Stable-GFlowNet phát hiện 134 kiểu tấn công riêng biệt, vượt xa 17 kiểu mà công nghệ trước đó tìm được. Tỷ lệ tấn công thành công vẫn giữ ở mức 92%. KAIST cho biết mô hình phòng thủ được huấn luyện bằng Stable-GFlowNet cũng cho thấy hiệu quả chống đỡ nhiều dạng tấn công trong bài kiểm tra tấn công chéo, ngay cả khi áp dụng các kỹ thuật tấn công khác.

Nhóm nghiên cứu nhận định công nghệ này không chỉ phục vụ kiểm định an toàn AI mà còn có thể mở rộng sang những lĩnh vực cần tìm kiếm nhiều ứng viên vừa đa dạng vừa chất lượng, như phát triển thuốc mới và khám phá vật liệu.

Nghiên cứu được chọn trình bày theo diện spotlight tại ICML 2026, thuộc nhóm 2,2% bài báo hàng đầu của hội nghị quốc tế này. Nghiên cứu sinh tiến sĩ Kwon Min-chan, Khoa Kỹ thuật Điện và Điện tử thuộc KAIST, là tác giả thứ nhất của công trình.

Theo giáo sư Kim Jun-mo, điểm cốt lõi của nghiên cứu là khả năng phát hiện ổn định nhiều lỗ hổng AI ngay cả trong môi trường thực tế có ít dữ liệu và nhiều nhiễu. Ông kỳ vọng đây sẽ trở thành công nghệ nền tảng giúp phát hiện và phòng thủ toàn diện trước rủi ro, trước khi AI tạo sinh được triển khai trong các dịch vụ thực tế.

Từ khóa

#KAIST #LLM #AI #red teaming #Stable-GFlowNet #GFlowNet #an toàn AI #ICML 2026
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.