Bộ Khoa học, Công nghệ và ICT Hàn Quốc cùng Cơ quan Xúc tiến Xã hội Thông tin Quốc gia Hàn Quốc (NIA) ngày 27/8 cho biết sẽ công bố miễn phí trên AI Hub 29 bộ dữ liệu huấn luyện do 5 doanh nghiệp tham gia giai đoạn đánh giá đầu tiên của dự án mô hình AI nền tảng nội địa xây dựng, gồm Naver Cloud, Upstage, SK Telecom, NC AI và LG AI Research.
Đây là các bộ dữ liệu do từng doanh nghiệp tự thiết kế và xây dựng theo chiến lược phát triển mô hình riêng. Toàn bộ được hình thành từ khoản ngân sách 15 tỷ won mà chính phủ hỗ trợ năm ngoái cho hoạt động xây dựng và xử lý dữ liệu.
Theo cơ quan quản lý, dữ liệu được mở lần này bao gồm dữ liệu văn bản quy mô lớn phục vụ tiền huấn luyện; dữ liệu đa phương thức như video và âm thanh; dữ liệu phục vụ hậu huấn luyện nhằm nâng cao năng lực suy luận và phát triển AI agent; cùng dữ liệu red teaming để kiểm định mức độ an toàn của mô hình.
Về quy mô, đợt công bố gồm 29 bộ dữ liệu thuộc nhiều nhóm như video, âm thanh, lĩnh vực chuyên môn, AI vật lý và red teaming, với tổng cộng khoảng 35,44 triệu mục dữ liệu, tương đương khoảng 1,56 nghìn tỷ token. Theo ước tính, lượng dữ liệu này đủ để huấn luyện một mô hình AI quy mô 70-80B.
Trong đó, Upstage xây dựng bộ dữ liệu tiền huấn luyện quy mô 1 nghìn tỷ token cùng 500.000 mục dữ liệu phục vụ hậu huấn luyện. Phần dữ liệu tiền huấn luyện có thể dùng để huấn luyện mô hình từ đầu.
Dữ liệu hậu huấn luyện của doanh nghiệp này được thiết kế để hỗ trợ phát triển AI agent, hướng tới các năng lực như suy luận, ra quyết định và thực thi tác vụ, thay vì chỉ dừng ở hỏi đáp đơn giản.
Naver Cloud tập trung vào bài toán hiểu video và huấn luyện AI tạo sinh. Doanh nghiệp đã xây dựng bộ dữ liệu gồm 2,34 triệu video công khai và 520.000 video phát sóng, đi kèm 15,5 triệu mục văn bản theo clip video và 12 triệu mục hỏi đáp bằng giọng nói.
Phần văn bản bao gồm các chú thích mô tả cảnh theo từng câu, có thể dùng để huấn luyện mô hình hiểu video cũng như mô hình tạo ảnh.
SK Telecom xây dựng dữ liệu suy luận đa bước có độ khó cao cho các lĩnh vực chuyên môn như toán học, khoa học và pháp luật, đồng thời chuẩn bị dữ liệu hậu huấn luyện dựa trên giọng nói và hình ảnh. Gói dữ liệu này cũng bao gồm khoảng 10.000 mục dữ liệu red teaming phản ánh hệ thống pháp luật trong nước và các giá trị phổ quát của xã hội Hàn Quốc.
Theo SK Telecom, trọng tâm của bộ dữ liệu là nâng năng lực giải quyết vấn đề thực tiễn, đồng thời kiểm chứng độ an toàn và độ tin cậy của mô hình.
NC AI xây dựng 7 nhóm dữ liệu về các năng lực cốt lõi của LLM, dựa trên dữ liệu từ hiện trường sản xuất như tài liệu kỹ thuật ngành chế tạo và dữ liệu âm thanh từ các hoạt động tư vấn, tiếp nhận khiếu nại. Nội dung bao gồm hiểu ngữ cảnh dài, suy luận theo từng bước, hội thoại nhiều lượt, hỏi đáp và học đa phương thức.
Bộ dữ liệu này có thể được sử dụng cho huấn luyện tích hợp văn bản - hình ảnh - âm thanh, đồng thời nâng hiệu quả hậu huấn luyện phục vụ nhu cầu công nghiệp.
LG AI Research đặt trọng tâm vào AI vật lý. Đơn vị này đã ghi hình hơn 50 hoạt động việc nhà trong 50 môi trường gia đình thực tế tại Hàn Quốc, tạo ra hơn 170.000 clip video.
Dữ liệu được gán nhãn nhiều lớp, gồm đối tượng, phân đoạn, tư thế và thông tin ngữ cảnh, phục vụ huấn luyện mô hình thị giác, mô hình thị giác - ngôn ngữ (VLM), cũng như nghiên cứu AI vật lý và phát triển dịch vụ thương mại.
Trước khi mở dữ liệu, Bộ Khoa học, Công nghệ và ICT Hàn Quốc cho biết đã phối hợp với NIA và Hiệp hội Công nghệ Thông tin và Truyền thông Hàn Quốc (TTA) để kiểm định chất lượng, rà soát dữ liệu cá nhân và các yếu tố độc hại. Những dữ liệu vướng ràng buộc về giấy phép đã bị loại khỏi danh sách công bố.
Theo quy định của chương trình, tối thiểu 50% dữ liệu được xây dựng từ ngân sách hỗ trợ của chính phủ phải được mở công khai. Naver Cloud, Upstage, SK Telecom và NC AI đã quyết định công bố toàn bộ dữ liệu vượt qua kiểm định chất lượng.
Trong khi đó, LG AI Research sẽ tiếp tục thống kê, chọn lọc và công bố dữ liệu để đáp ứng ngưỡng bắt buộc từ 50% trở lên.
Người dùng có thể tải miễn phí 29 bộ dữ liệu này tại mục “dữ liệu mô hình AI nội địa” trên AI Hub. Nền tảng cũng hỗ trợ tìm kiếm theo doanh nghiệp và theo loại dữ liệu.
Một phần dữ liệu sẽ được cung cấp thông qua “vùng an toàn” - môi trường phát triển AI trực tuyến bảo mật - sau khi người dùng hoàn tất thủ tục đăng ký riêng.
Bộ Khoa học, Công nghệ và ICT Hàn Quốc cho biết sẽ tiếp tục mở thêm các bộ dữ liệu mới được xây dựng trong giai đoạn đánh giá thứ hai của dự án sau khi hoàn tất kiểm định chất lượng.
Ông Kim Kyeong-man, Vụ trưởng Vụ Chính sách AI thuộc Bộ Khoa học, Công nghệ và ICT Hàn Quốc, cho biết dự án mô hình AI nền tảng nội địa có ý nghĩa ở chỗ góp phần nâng chất lượng tăng trưởng của toàn bộ hệ sinh thái AI thông qua kinh nghiệm và năng lực tích lũy trong quá trình phát triển mô hình. Theo ông, đợt công bố dữ liệu lần này sẽ trở thành nền tảng để thúc đẩy tăng trưởng và củng cố năng lực tự chủ của hệ sinh thái AI.