在韩国“独立AI基础模型”项目第二阶段评测中落选的Motif Technologies,与排名第三的LG AI Research综合得分仅相差3.2分。虽然Motif在基准测试环节位居四家入围企业之首,但在专家评审和用户评测中明显落后,最终排名第四。
韩国科学技术信息通信部27日公布了第二阶段评分明细,涉及Upstage、SK Telecom、LG AI Research和Motif四家入围企业。
从综合成绩来看,SK Telecom以70.6分排名第一,Upstage以69.9分位列第二,LG AI Research以69.0分排名第三,Motif为65.8分。LG AI Research与Motif之间的分差为3.2分。
本轮评测总分为100分,由基准测试40分、专家评审35分和用户评测25分构成。其中,用户评测又分为AI专业用户评测15分和普通公众评测10分。
分项成绩显示,Motif在基准测试中获得24.6分,超过Upstage的22.7分、SK Telecom的22.2分以及LG AI Research的20.6分,排名第一。
基准测试由Artificial Analysis Intelligence Index(AAII)25分和韩国智能信息社会振兴院(NIA)基准测试15分组成。AAII评分方面,Motif以11.9分居首,Upstage为9.4分,SK Telecom为8.8分,LG AI Research为7.8分。
不过在NIA基准测试中,SK Telecom以13.4分排名第一,Upstage为13.3分,LG AI Research为12.8分,Motif为12.7分。
但进入专家评审环节后,排名出现逆转。LG AI Research以29.5分拿到该项最高分,SK Telecom为29.3分,Upstage为29.1分,Motif为27.1分。
据介绍,专家评审由10名外部专家参与,其中包括3名产业界人士、5名学界人士和2名研究机构人士,主要评估开发战略与技术、开发成果与计划,以及影响力和贡献计划等内容。各团队成绩为去掉评委评分中的最高分和最低分后,取其余分数的算术平均值。
在用户评测环节,差距进一步拉大。SK Telecom获得19.1分,LG AI Research为18.9分,Upstage为18.1分,Motif则以14.1分垫底。仅这一环节,LG AI Research就领先Motif 4.8分。
进一步来看,在49名专业用户参与的AI专业用户评测中,SK Telecom以11.6分排名第一,LG AI Research为11.3分,Upstage为10.8分,Motif为8.4分。
在面向185名普通公众的评测中,LG AI Research以7.6分位居第一,SK Telecom为7.5分,Upstage为7.3分,Motif为5.7分。
这意味着,尽管Motif在基准测试中领先LG AI Research 4.0分,但在专家评审中落后2.4分,在用户评测中落后4.8分,最终综合得分反而低出3.2分。
值得注意的是,上述分项成绩的公布,发生在Motif当天正式就第二阶段评测结果提出异议之后。Motif在声明中表示,其模型“Motif 3”虽然在AAII中获得最高分,却仍遭淘汰,因此要求公开详细评分结果并启动复审。
Motif还称,基准测试中的分差在折算为最终分值后被压缩,并要求公开专家评审的细分标准及用户评测方法。该公司指出,如果普通用户是在知晓模型开发方信息的情况下参与评测,品牌认知或先入为主的印象可能影响结果,因此有必要引入盲评机制。
不过,Motif强调,提出异议并不意味着要求重新入选;无论异议处理结果如何,公司都不会参与第三阶段。
韩国科学技术信息通信部表示,该项目并非以简单排名或淘汰企业为目的,而是着眼于推动本土AI企业成长,提升并扩大韩国国内AI生态。对于评测结果的公开范围,主管部门将综合考虑公开可能对企业造成的影响,以及评测流程和结果的公正性与透明度。