参与韩国政府“自主AI基础模型”项目的5支首阶段团队,已将模型开发过程中建设和积累的大规模训练数据面向韩国AI生态开放。
韩国科学技术信息通信部和韩国智能信息社会振兴院(NIA)27日表示,Naver Cloud、Upstage、SK Telecom、NC AI、LG AI Research等5支团队已通过AI Hub对外公开相关数据。
此次开放的数据由上述团队根据各自的模型开发战略自行规划和建设,相关数据建设与加工获得韩国政府去年150亿韩元预算支持。
从类型看,公开数据涵盖预训练用大规模文本数据、视频和音频等多模态数据、面向高难度推理和AI Agent开发的后训练数据,以及用于检验模型安全性的红队测试数据。
从规模看,本次共开放视频、音频、专业领域、Physical AI、红队测试等29类数据,合计约3544万条,折合约1.56万亿Token,理论上可支持70B至80B参数级大模型训练。
Upstage数据规模最大,Naver Cloud聚焦视频理解与生成式AI
其中,Upstage建设了约1万亿Token的预训练数据,以及50万条后训练数据。前者可用于从零训练大模型,后者则适用于推理、判断和执行能力要求更高的AI Agent开发。
Naver Cloud重点布局视频理解和生成式AI训练,建设了234万条公开视频、52万条广播视频,以及基于视频片段生成的1550万条文本数据和1200万条语音问答数据。其中,文本数据包含按句描述画面的字幕等内容,可用于训练视频理解模型和图像生成模型。
SK Telecom则准备了覆盖数学、科学、法律等专业领域的高难度多步推理数据,以及基于语音和图像的后训练数据。此外,该公司还建设了约1万条反映韩国国内法规和社会普遍价值观的红队测试数据,在提升模型解决实际问题能力的同时,侧重验证其安全性和可信度。
NC AI基于制造业技术文档、公众咨询通话音频等真实产业场景数据,建设了7类LLM核心能力数据,覆盖长上下文理解、分步推理、多轮对话、问答和多模态学习等方向。这些数据既可用于产业场景下的文本、图像、语音融合训练,也可用于提升后训练效果。
LG AI Research则将重点放在Physical AI。该机构在韩国国内50个真实家庭环境中拍摄了50多种家务活动,建设了超过17万条视频片段,并对目标、分割、姿态和语境信息进行了多层标注,以支持视觉模型和视觉语言模型(VLM)训练,以及Physical AI研究和商业化服务开发。
29类数据免费开放,后续还将追加公布第二阶段数据
韩国科学技术信息通信部表示,在本次开放前,相关数据已通过NIA和韩国信息通信技术协会(TTA)的质量核验,并完成隐私和有害性检查;受授权限制的数据不在本次开放范围内。
根据项目要求,使用政府数据建设和加工预算形成的数据中,至少50%必须对外开放。此次,Naver Cloud、Upstage、SK Telecom、NC AI决定公开全部通过质量核验的数据;LG AI Research则在满足“至少开放50%”这一强制标准的前提下,对数据筛选后开放。
本次公开的29类数据已在AI Hub“自主AI模型数据”栏目上线,公众均可免费下载使用,并可按团队和数据类型进行检索。部分数据则需另行申请,方可在具备安全保障的在线AI开发环境“安信区”中使用。
韩国科学技术信息通信部还表示,后续将在“自主AI基础模型”项目第二阶段评估过程中,对新建设的数据完成质量核验后继续追加开放。
韩国科学技术信息通信部人工智能政策室室长Kim Kyung-man表示,“自主AI基础模型”项目的意义,在于将模型开发过程中积累的经验和方法论扩展至整个AI生态,推动产业实现质的提升,而此次数据开放也将成为增强生态自生能力的重要基础。