韩国“独立AI基础模型”(DokPaMo)项目标识(资料图)

韩国政府推进的“独立AI基础模型”项目,在二轮评审中引入了公众测评环节。此次测评采取4款模型对比体验的方式展开,评估内容涵盖对话、摘要、创作和安全等多个维度,并结合示例问题与参与者自主提问进行打分。

DigitalToday于12日查阅公众测评团获得的测评指引等材料后获悉,本轮公众测评面向LG AI Research、SK Telecom、Upstage和Motif Technologies4家进入二轮评审的模型同步进行。

根据测评指引,主办方为参与者提供了4个测评领域的示例问题,并要求每个领域至少使用1个示例问题。与此同时,参与者还可额外提出1至2个自拟问题。

在具体流程上,测评者需针对同一问题依次体验4个模型。每个模型限时约3分钟,参与者在查看回答并完成评分后,方可切换至下一个模型。按此计算,完成单个问题的4模型测评约需12分钟。

公众测评团共200人,由普通公众组成,依据居民登记人口统计结构,综合性别和年龄比例随机抽取。测评于8日至11日进行,结果将纳入项目二轮评审。

此次测评分为4个领域,分别是日常对话与常识、摘要与信息整理、创意表达与语体转换,以及有害内容拦截。

在“日常对话与常识”领域,测评重点包括语言表达是否自然、解释是否清晰,以及建议和规划是否具有实际参考价值。示例问题包括:将复杂科学原理讲解给儿童听懂,或就职场生活给出贴近现实的建议。

在“摘要与信息整理”领域,重点考察模型对长文本核心信息的提炼和结构化输出能力,以及能否按照既定标准,对多条评价和反馈进行分类整理。

在“创意表达与语体转换”领域,主要评估模型围绕韩语表达方式和语感的创作能力,以及将口语化表达改写为正式工作文档等文本的能力。

安全能力也被纳入重要评估范围。测评重点包括,模型能否明确拒绝涉及诈骗手法、辱骂或侮辱性表达等违反社会规范的请求;同时,在加入“小说反派台词”等设定、以迂回方式诱导生成危险内容时,模型是否能够识别并拦截相关输出。

韩国科学技术信息通信部相关人士表示,考虑到普通公众可能并不熟悉提示词使用方式,为兼顾测评便利性和公平性,主办方提供了基础示例问题;与此同时,也允许参与者在3分钟的引导式测评之外,自主提问并体验模型表现。

评分方面,公众测评采用5分制,1分为“非常不足”,5分为“非常优秀”。

有实际参与测评的普通用户表示,与专业AI基准测试相比,此次评价更偏向从普通使用体验出发,重点看回答速度、内容质量等体感表现。

一名50多岁的参与者表示,自己是在查看模型回答后,以普通用户视角进行评分;如果回答较好,通常会给4分,否则会给出更低分数。

该参与者还表示,几款模型与ChatGPT等全球模型相比,并未让人明显感到存在“非常大的差距”,整体响应速度也基本正常;不过,部分模型仍存在生成耗时较长或运行不够流畅的情况。

包含公众测评在内的二轮评审结果,最快预计将于本周内公布。LG AI Research、SK Telecom、Upstage和Motif Technologies4支团队中,将有3支进入下一阶段。

关键词

#独立AI基础模型 #公众测评 #韩国科学技术信息通信部 #LG AI Research #SK Telecom #Upstage #Motif Technologies #安全 #示例问题 #二轮评审
版权所有 © DigitalToday。未经授权禁止转载或传播。