韩国放送通信委员会与韩国电波振兴协会(RAPA)5日表示,将通过韩国智能信息社会振兴院(NIA)“AI-Hub安全专区”开放部分广播视频AI训练数据,供教育和科研用途免费使用。
此次开放的数据总量为117万5800条,体现韩国文化特色和情感表达,覆盖3大领域共10类数据,包括视频和图像理解与描述、背景与人物及对象生成,以及内容制作提效等方向。
其中,在理解与描述领域,开放数据包括广播视频图像字幕标注数据29万4906条、视频字幕标注数据21万7587条,以及K-内容视频理解数据3万7940条等。
在生成领域,开放数据包括韩国风格背景与对象生成数据12万8689条、韩国情感人物生成数据9万6991条,以及K-内容人物Persona生成数据9万5446条等。
在内容制作提效领域,开放数据包括K-内容视觉语言模型(VLM)数据4万3604条、字体生成数据15万1334条,以及字幕生成数据8万6350条等。
韩国放送通信委员会表示,广播视频一直是AI训练的重要数据来源,但由于涉及知识产权、肖像权和邻接权等问题,相关数据在实际使用中一直存在限制。此次开放有望推动开发者开展基于广播视频的AI模型研究。
上述数据可在AI-Hub安全专区内使用。该专区在安全管控环境下提供数据使用空间,用户需提前申请并通过审核,获批后即可免费使用。
韩国放送通信委员会广播媒体振兴局局长Cheon Ji-hyeon表示,广播视频既汇聚了韩国文化特色和情感表达,也体现出较高水平的制作技术与专业能力,是AI产业的重要核心资产。今后将持续建设并开放高质量AI训练数据,推动其在更多产业场景中落地应用。