Motif Technologies标识。

Motif Technologies就韩国政府“独立AI基础模型”项目第二阶段评估结果提出异议,并要求公开各项评分细则及标准,同时申请启动复核。

Motif Technologies于27日发布立场文件称,已于当天正式向韩国科学技术信息通信部提交针对“独立AI基础模型”第二阶段入选结果的异议申请。

该公司表示,其自研模型“Motif 3”在全球AI模型综合性能指标Artificial Analysis Intelligence Index(AAII)中获得47分,在所有参评模型中得分最高;但在18日公布的第二阶段评估结果中却得分最低,最终未能入围。公司同时列举称,Upstage为37分,SK Telecom为35分,LG AI Research为31分。

Motif Technologies表示,尊重并接受评估结果本身,但主管部门随后给出的说明称,“Motif 3在专家评估和用户评估中的易用性、可用性相对较弱”。在此情况下,公司认为有必要进一步公开具体评分标准及评估结果。

该公司认为,基础模型的核心价值不应主要以聊天机器人场景下的易用性来衡量,而应体现在可向多个领域扩展的底层能力上。考虑到该项目最初目标是使国内模型达到全球领先模型95%以上的性能水平,如果在认定本土模型性能“已经足够”的前提下,将评估重点转向易用性,显然与项目宗旨不符。

Motif Technologies介绍称,本次评估总分为100分,其中基准测试占40分,专家评估占35分,用户评估占25分。基准测试又由AAII的25分和韩国智能信息社会振兴院(NIA)评估的15分构成。

公司指出,基准测试成绩在折算为实际评估分值后,模型之间的性能差距被明显压缩。以AAII得分为例,Motif 3的47分与LG AI Research模型的31分相差16分,但折算为25分制后,分差被缩小至4分。

基于上述问题,Motif Technologies已要求韩国科学技术信息通信部公开以下内容:一是全部评估项目中各参评企业的详细得分及评分标准;二是基准测试分值的折算方法及其依据;三是专家评估的具体标准与结果;四是用户评估的方法、详细标准及结果。

在用户评估方面,Motif Technologies表示,此前曾以大型企业与初创公司之间的品牌认知差异可能影响评分为由,提出采用盲评的要求,但评估方式和相关条件并未得到充分公开。公司强调,如果基准测试中体现出的模型性能差距,在用户评估环节被反转,就应提供可供核验的具体依据。

不过,Motif Technologies同时强调,此次提出异议并不意味着要求公司“重新入选”。公司表示,无论异议处理结果如何,都不会参加“独立AI基础模型”项目第三阶段评估。

Motif Technologies还表示,希望借此次异议推动外界重新讨论该项目的设立初衷,并形成所有竞争方都能接受的改进方向。公司称,未来将继续依靠自身力量打造韩国最优秀的前沿模型,并证明其具备在全球竞争中胜出的能力。

关键词

#Motif Technologies #Motif 3 #独立AI基础模型 #韩国科学技术信息通信部 #AAII #NIA #第二阶段评估 #基准测试 #用户评估 #评分细则
版权所有 © DigitalToday。未经授权禁止转载或传播。