独立AI基础模型相关示意图(图片来源:ChatGPT)

韩国科学技术信息通信部20日补充披露“独立AI基础模型”项目第二阶段评估的分项结果。从单项来看,Motif Technologies在全球基准测试中得分最高,SK Telecom在韩国智能信息社会振兴院(NIA)基准测试和AI专业用户评测中领先,LG AI Research则在专家评审和普通公众评测中位居第一。

韩国科学技术信息通信部此前于18日公布第二阶段评估结果时,并未公开各分项排名第一的企业及具体得分。该部门当时解释称,参考第一阶段评估期间引发的争议,若公开单项第一名,可能会对相关企业产生过度抬升市场认知的效果,也可能给其他企业带来标签化影响。

不过,在外界就评估透明度提出质疑后,韩国科学技术信息通信部决定扩大披露范围。第二阶段评估总分由三部分构成,分别为基准测试40分、专家评审35分和用户评测25分。

在基准测试部分,作为全球评测项目的Artificial Analysis Intelligence Index(AAII)中,Motif Technologies以11.9分(满分25分)排名第一,4家参评团队平均得分为9.48分。

AAII评测涵盖多项全球基准,包括Agent领域的GDPval-AA v2和Tau3-Banking(τ3-Banking),编程领域的Terminal-Bench v2.1和SciCode,以及通用和科学推理等项目。其中,Agent领域在AAII总评分中的占比为34%,为各项中最高。

在NIA基准测试中,SK Telecom以13.4分(满分15分)位列第一。该项评测覆盖数学、知识、长文本理解、安全性、可信性、韩语和指令执行等7个领域,4家参评团队平均得分为13.05分。

在满分35分的专家评审环节,LG AI Research以29.5分排名第一,4家参评团队平均得分为28.75分。

专家评审由10名外部专家组成,其中产业界3人、学界5人、研究机构2人。评审维度包括开发战略与技术、开发成果与后续计划,以及生态建设和全球影响力等;模型的易用性、实用性以及在不同领域和场景中的适配能力,也被纳入评价范围。

用户评测部分由AI专业用户评测和普通公众评测组成,分值分别为15分和10分。在AI专业用户评测中,共有49人参与,包括AI初创企业代表等,SK Telecom以11.6分排名第一,4家参评团队平均得分为10.53分。

面向普通公众的评测按性别和年龄配额随机抽取200人,实际参与185人。LG AI Research以7.6分(满分10分)位列第一,4家参评团队平均得分为7.03分。

关键词

#韩国科学技术信息通信部 #独立AI基础模型 #AAII #NIA #Motif Technologies #SK Telecom #LG AI Research #基准测试 #专家评审 #用户评测
版权所有 © DigitalToday。未经授权禁止转载或传播。