Ông Kim Min-woo, Trưởng nhóm AI Safety tại SelectStar. Ảnh: SelectStar

Kim Min-woo, Trưởng nhóm AI Safety tại SelectStar, cho rằng an toàn AI (AI safety) không thể được đánh giá theo cách của an ninh mạng truyền thống, mà cần một hệ thống tiêu chí riêng. Theo ông, khi AI tạo sinh đưa ra câu trả lời dựa trên xác suất, các rủi ro như ảo giác, phát ngôn thù ghét, thiên lệch hay nội dung độc hại cũng xuất hiện theo cách khác với các vấn đề bảo mật thông thường.

Ông nhấn mạnh những yếu tố như ảo giác, độ xác thực của thông tin, hay các phản hồi mang tính thù ghét và thiên lệch thuộc phạm vi AI safety, không phải an ninh mạng.

Một trong những phương pháp tiêu biểu để kiểm tra các rủi ro này là AI red teaming. Cách làm này mô phỏng nhiều kịch bản tấn công để kiểm tra trước liệu mô hình có tạo ra phản hồi ngoài dự kiến hoặc gây hại hay không, qua đó xác định điểm yếu. Kim Min-woo mô tả đây là “chuỗi quy trình hoặc kỹ thuật nhằm đánh lừa AI để dẫn tới câu trả lời không mong muốn”.

Tầm quan trọng của AI safety ngày càng tăng khi AI tạo sinh không còn dừng ở mô hình hỏi đáp, mà đang chuyển sang tác nhân AI (agent) có thể sử dụng công cụ bên ngoài. Các công ty AI toàn cầu như OpenAI và Anthropic đều đang đẩy mạnh red teaming nội bộ và đánh giá rủi ro trước khi phát hành mô hình. Tại Hàn Quốc, Cơ quan Internet và An ninh Hàn Quốc (KISA) tháng trước cũng đã công bố “Hướng dẫn AI Security Red Teaming”.

SelectStar hiện phát triển dữ liệu đánh giá safety, mô hình tấn công tự động và công nghệ đánh giá mức độ an toàn của phản hồi do AI tạo ra. Công ty đồng thời nghiên cứu các kỹ thuật blue teaming, trong đó có guardrail, nhằm chặn những phản hồi bị xác định là có vấn đề.

Theo Kim Min-woo, AI red teaming không chỉ là nhập các câu hỏi bị cấm. Mô hình tấn công tự động sẽ biến đổi câu hỏi thành những prompt có khả năng vượt qua rào chắn, rồi kiểm tra xem AI có thực sự tạo ra phản hồi độc hại hay không.

Ông cho rằng việc “chỉ thử tấn công theo thật nhiều cách” mới chỉ là red teaming ở mức cơ bản. “Có những khu vực AI có thể tự phát hiện, và cũng có những khu vực con người thực tế sẽ thử tấn công; cả hai đều quan trọng”, ông nói. SelectStar hiện vận hành song song mô hình tự động hóa cách tấn công của con người và mô hình tấn công chuyên biệt cho AI.

Tiêu chí xác định rủi ro cũng thay đổi tùy theo từng ngành. Với AI mục đích chung, thông tin liên quan đến hóa học, sinh học, phóng xạ và hạt nhân (CBRN) có thể là rủi ro trọng yếu. Trong khi đó, với AI doanh nghiệp, nguy cơ rò rỉ bí mật kinh doanh hoặc dữ liệu cá nhân có thể quan trọng hơn. Vì vậy, các chuyên gia theo lĩnh vực am hiểu đặc thù rủi ro của từng ngành cũng tham gia vào quá trình đánh giá.

Kim Min-woo cho rằng việc áp dụng nguyên bản các benchmark AI safety từ nước ngoài vào thị trường nội địa có những giới hạn nhất định. “Nếu chỉ dịch sát hoặc chuyển ngữ benchmark nước ngoài, yếu tố văn hóa hoặc mục tiêu đánh giá có thể không phù hợp với bối cảnh Hàn Quốc”, ông nói, đồng thời nhấn mạnh cần liên tục xây dựng các benchmark safety phù hợp với tình hình trong nước.

Sự phổ biến của AI agent cũng khiến việc đánh giá safety trở nên phức tạp hơn. Khi AI được kết nối với cơ sở dữ liệu nội bộ, RAG, API và các plugin bên ngoài, rủi ro vẫn có thể phát sinh từ các thành phần ngoại vi hoặc từ cách thiết kế phân quyền, ngay cả khi bản thân mô hình được đánh giá là an toàn.

Kim Min-woo cho biết vì câu trả lời cuối cùng vẫn do AI tạo ra, nên rủi ro phát sinh ở bất kỳ thành phần nào cũng được xem là rủi ro của toàn bộ dịch vụ AI. Theo ông, red teaming chỉ dựa trên prompt thường khó xác định chính xác lỗi xuất phát từ đâu, nên trong một số trường hợp phải kiểm tra lần lượt cơ sở dữ liệu, plugin và quyền truy cập.

Ông nhận định chính những đặc thù này đang mở ra cơ hội cho các doanh nghiệp AI Hàn Quốc trong lĩnh vực safety. Trong cuộc đua về hiệu năng mô hình, các Big Tech toàn cầu đang chiếm ưu thế. Tuy nhiên, AI safety lại đòi hỏi tính bản địa hóa theo ngôn ngữ, văn hóa và hệ thống pháp luật, quy định của từng quốc gia.

Kim Min-woo nhấn mạnh AI safety vừa có các tiêu chuẩn an toàn mang tính toàn cầu, vừa có lớp safety phải được nội địa hóa theo từng nước. Ông cho rằng do tiêu chí rủi ro và quy định trong nước liên tục thay đổi, các Big Tech toàn cầu khó có thể theo kịp mọi biến động.

Ông nói thêm, năng lực phát triển công nghệ riêng để phản ánh các yếu tố này vào môi trường và ngành nghề trong nước có thể biến AI safety thành một “đại dương xanh”.

Từ khóa

#trí tuệ nhân tạo #AI safety #AI red teaming #SelectStar #KISA #RAG #AI agent
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.