随着全球大语言模型(LLM)竞争重心从“能回答问题”转向“能调用工具完成任务”,Agentic AI正成为行业关注的焦点。在这一趋势下,韩国政府“独立AI基础模型”项目如何评估模型的相关能力,也受到外界关注。
据韩国相关部门14日消息,该项目第二轮测评延续首轮框架,仍由基准测试、专家测评和用户测评三部分组成。与首轮相比,最大变化在于用户测评方式的调整。
首轮用户测评由49名专业用户参与,包括AI企业负责人等。第二轮则将用户测评拆分为两部分:一部分是专业用户测评,另一部分是面向200名普通公众的公众测评。
韩国科学技术信息通信部表示,将根据不同测评目的,区分是否允许使用外部工具,以分别观察模型自身能力与Agentic AI能力。
该部门相关人士称,专业用户测评将聚焦LLM本身的能力,因此限制工具调用等操作;专家测评则允许自由调用工具。该人士还表示,相关部门已搭建起可较为客观检验参评模型Agentic AI能力的测评体系。
所谓Agentic AI,是指LLM不再停留于回答问题,而是能够围绕既定目标拆解任务、选择并调用外部工具,完成多步骤工作流程,必要时还可使用搜索、数据库查询和外部应用执行等能力。
除专家测评外,基准测试同样被用于评估模型的Agentic AI能力。首轮测评采用了韩国信息化振兴院(NIA)制定的本土AI模型性能测评集,以及通用基准测试和专项基准测试。其中,通用基准测试共13项,覆盖Agentic AI能力、数学、知识和推理等多个维度。
不过,出于公平性等因素考虑,韩国科学技术信息通信部并未公开实际测评所采用的全球基准测试清单。
在全球市场上,围绕Agentic AI能力的细分基准测试已日趋丰富。全球AI模型测评机构Artificial Analysis将“tau3-Banking”归为衡量Agentic工具使用能力的指标,将“Terminal-Bench v2.1”归为衡量Agentic编码与终端使用能力的指标,将“GDPval-AA v2”归为衡量真实工作任务执行能力的指标。
此次参与第二轮测评的4款模型,均已公开上述3项基准测试的成绩。
在衡量真实工作任务执行能力的GDPval-AA中,Motif Technologies的“Motif 3”得分为39%,Upstage的“Sola Open2”为31%,SK Telecom的“A.DotX K2”为30%,LG AI Research的“K-EXAONE 2.0”为24%。
在衡量外部工具使用能力的tau3-Banking中,“Motif 3”为35%,“Sola Open2”为22%,“A.DotX K2”为16%,“K-EXAONE 2.0”为12%。
在衡量Agentic编码与终端使用能力的Terminal-Bench v2.1中,“Motif 3”为75%,“Sola Open2”为44%,“K-EXAONE 2.0”为40%,“A.DotX K2”为39%。
不过,上述基准测试本质上仍是在特定环境下,对模型部分Agentic AI能力进行测量的指标。单项基准测试得分,难以直接等同于模型整体的Agentic AI能力,更不能简单视为其在产业现场的实际可用性。
业内人士认为,除了基准测试成绩,更重要的是在真实工作环境中验证模型的落地可用性。韩国科学技术院(KAIST)讲席教授Choi Jae-sik表示,在当前全球AI竞争中,Agentic AI已成为关键方向,韩国自研模型同样需要把能力提升到可实际落地应用的水平;不能只停留在基准测试分数上,而应在编码、办公自动化等具体场景中,通过实证进一步验证其可用性。