Ủy ban Truyền thông Hàn Quốc (KCC) và Hiệp hội Xúc tiến Vô tuyến Hàn Quốc (RAPA) ngày 5/8 cho biết sẽ mở một phần dữ liệu huấn luyện trí tuệ nhân tạo (AI) về nội dung phát sóng thông qua khu vực an toàn của AI-Hub do Cơ quan Xã hội Thông tin và Trí tuệ Hàn Quốc (NIA) vận hành. Nguồn dữ liệu này được cung cấp cho mục đích giáo dục và nghiên cứu.
Theo KCC, bộ dữ liệu lần này gồm tổng cộng 1.175.800 hạng mục dữ liệu huấn luyện AI liên quan đến nội dung phát sóng, phản ánh văn hóa và cảm xúc đặc trưng của Hàn Quốc. Dữ liệu được chia thành 3 nhóm lớn với 10 loại, gồm hiểu và mô tả hình ảnh, video; tạo bối cảnh, nhân vật, vật thể; và nâng cao môi trường sản xuất.
Ở nhóm hiểu nội dung, dữ liệu được công bố gồm 294.906 mục chú thích hình ảnh phát sóng, 217.587 mục chú thích video và 37.940 mục dữ liệu phục vụ hiểu video K-content.
Ở nhóm tạo sinh, bộ dữ liệu bao gồm 128.689 mục tạo bối cảnh và vật thể mang đặc trưng Hàn Quốc, 96.991 mục tạo nhân vật theo cảm xúc Hàn Quốc và 95.446 mục tạo persona nhân vật cho K-content.
Trong nhóm nâng cao môi trường sản xuất, dữ liệu được mở gồm 43.604 mục dành cho mô hình thị giác - ngôn ngữ (VLM) của K-content, 151.334 mục tạo font chữ và 86.350 mục tạo phụ đề.
KCC cho biết nội dung phát sóng vốn là nguồn dữ liệu có giá trị cao đối với việc huấn luyện AI, nhưng trước đây việc khai thác còn bị hạn chế do vướng các vấn đề về quyền sở hữu trí tuệ, quyền chân dung và các quyền liên quan. Cơ quan này kỳ vọng đợt mở dữ liệu lần này sẽ giúp giới phát triển đẩy mạnh nghiên cứu và phát triển các mô hình AI ứng dụng nội dung phát sóng.
Toàn bộ dữ liệu được cung cấp tại khu vực an toàn của AI-Hub, nơi người dùng có thể khai thác dữ liệu trong môi trường bảo mật và có kiểm soát. Người dùng được sử dụng miễn phí sau khi đăng ký trước và được phê duyệt.
Ông Cheon Ji-hyeon, Cục trưởng Cục Xúc tiến Truyền thông Phát sóng thuộc KCC, cho biết nội dung phát sóng là tài sản cốt lõi của ngành AI, hội tụ cả văn hóa, cảm xúc đặc trưng của Hàn Quốc lẫn công nghệ và năng lực sản xuất chuyên sâu. Ông nói KCC sẽ tiếp tục xây dựng và công bố các bộ dữ liệu huấn luyện AI chất lượng cao để mở rộng ứng dụng của nội dung phát sóng trong nhiều lĩnh vực.