Ngày 18/8, Kakao công bố kết quả đánh giá an toàn đối với dòng mô hình ngôn ngữ cỡ nhỏ do hãng tự phát triển. Theo doanh nghiệp, hai mô hình mã nguồn mở thuộc series Kanana-2 đạt điểm cao hơn các mô hình toàn cầu cùng quy mô ở các tiêu chí như độc hại và thiên lệch, qua đó nằm trong nhóm có mức an toàn cao.
Trước đó, ngày 28/7, Kakao đã phát hành trên Hugging Face hai mô hình ngôn ngữ cỡ nhỏ (SLM) là Kanana-2-1.3B-Instruct và Kanana-2-3B-Instruct. Kết quả đo lường cho thấy cả hai đều dẫn đầu về tổng điểm ở các hạng mục đánh giá độc hại và thiên lệch.
Đợt đánh giá được thực hiện bằng AssurAI, bộ benchmark an toàn được thiết kế dựa trên bối cảnh xã hội và văn hóa Hàn Quốc. AssurAI do TTA, KAIST và Kakao cùng phát triển từ tháng 11 năm ngoái trong khuôn khổ một dự án của Bộ Khoa học và ICT.
Bộ benchmark này đánh giá các yếu tố rủi ro của AI trong nhiều điều kiện khác nhau, từ tình huống sử dụng dịch vụ thực tế đến các kịch bản truy vấn mang tính gây hại, trên nhiều định dạng gồm văn bản, hình ảnh và âm thanh.
AssurAI gồm 9.560 câu hỏi đánh giá, trải rộng trên 35 hạng mục rủi ro. Kakao sau đó tái cấu trúc các hạng mục này thành 5 nhóm chính gồm rủi ro xã hội; nội dung tình dục và bảo vệ trẻ em; tội phạm và hành vi phi pháp; bạo lực; xâm phạm quyền lợi.
Công ty cũng áp dụng phương pháp “LLM-as-a-Judge”, tức dùng AI để chấm phản hồi của một AI khác theo thang điểm định sẵn, nhằm giảm chênh lệch giữa các lượt đánh giá trong những bài kiểm tra quy mô lớn.
Các mô hình được dùng để đối chiếu là Gemma của Google và Qwen của Alibaba. Cả Kanana-2-1.3B-Instruct và Kanana-2-3B-Instruct đều đạt điểm tổng hợp 0,70, cao hơn Gemma với 0,68 và 0,66, đồng thời vượt Qwen với 0,58 và 0,62.
Theo Kakao, nếu xét theo từng nhóm rủi ro, bản 1.3B nổi trội hơn ở nhóm tội phạm và hành vi phi pháp, trong khi bản 3B dẫn trước ở các nhóm nội dung tình dục và bảo vệ trẻ em, cùng xâm phạm quyền lợi.
Kakao cho biết sẽ lấy kết quả lần này làm cơ sở để mở rộng cơ chế đánh giá an toàn trước phát hành thành quy trình thường xuyên cho toàn bộ các mô hình AI do hãng phát triển. Doanh nghiệp cũng có kế hoạch mở rộng phạm vi từ mô hình ngôn ngữ dựa trên văn bản sang mô hình đa phương thức, đồng thời đánh giá rủi ro đối với AI tác tử theo từng giai đoạn.
Ông Kim Kyung-hoon, AI Safety Leader của Kakao, cho biết đây là trường hợp công ty chủ động kiểm tra độ an toàn của mô hình mã nguồn mở bằng hệ thống xác minh nội bộ trước khi phát hành, đồng thời công bố công khai kết quả. Theo ông, Kakao sẽ tiếp tục đưa kiểm chứng an toàn trở thành một bước cốt lõi trong quy trình ra mắt mô hình, trên cơ sở nguyên tắc phát triển AI có trách nhiệm.