随着韩国政府加快推进面向全民提供AI服务的“全民AI”项目,市场对于其性能评估标准仍不够明确的担忧也在升温。由于现有评审框架较多围绕企业自行设定的指标以及用户规模展开,外界认为,项目仍需建立更客观、透明的验证机制。
韩国科学技术信息通信部与信息通信产业振兴院(NIPA)7月21日在首尔麻浦区Front1举行“全民AI”项目说明会,介绍项目定位、遴选条件和推进时间表。
根据官方规划,“全民AI”项目的核心,是依托韩国本土AI模型,向公众提供通用型AI聊天机器人,并逐步拓展至AI智能体服务。韩国政府希望借此降低对海外AI服务的依赖,同时缩小AI使用门槛带来的差距,让更多民众能够直接使用AI服务。
按计划,韩国科学技术信息通信部最晚将于8月结束项目征集,并在9月确定参与企业或联合体。入选企业将获得政府今年已落实的512块B200图形处理器(GPU)资源支持。
在模型使用条件方面,参与企业必须采用本土AI模型。其中,符合独立基础模型标准、由企业自主预训练形成的本土模型占比需达到50%以上;同时,还须引入其他企业开发的本土模型,使用比例不低于30%。对于高难度推理、多模态等部分功能,则可在限定范围内使用海外模型。
时间安排也较为紧凑。入选企业需在9月底前启动测试版服务,并于12月面向公众推出AI聊天机器人服务。该通用型AI聊天机器人原则上将免费开放,且不设使用量限制。韩国政府还计划自2027年起将服务升级为AI智能体形态,推动“全民一人一个AI智能体”的目标。
不过,围绕项目评估机制,现场也出现了不少质疑声音。外界关注的焦点在于,现行方案中尚缺少一套清晰、统一的客观标准,用于判断各家服务的实际性能。
根据项目征集说明,参选企业需按年度提出具体、可量化的目标和绩效指标。其中,应用推广相关绩效指标主要由企业自行提出并自行举证。无论是用户数、Token使用量,还是目标值和最低达标值,均可由企业自行设定,同时提交与之对应的GPU需求规模及测算依据。
在评审流程上,韩国科学技术信息通信部将先依据企业提交的方案,对AI模型竞争力、GPU使用计划、服务开发计划等内容进行书面评审,随后通过路演评审确定最终排名。
从评分结构看,路演评审中占比最高的是“服务易用性及用户获取、留存方案”,分值为50分;“服务质量与安全性”为30分。相比之下,涉及响应准确性、实用性、一致性、上下文理解能力以及性能验证计划的“服务质量与性能”项目仅占10分。与此同时,说明文件中并未单独明确用于横向比较候选服务的统一基准测试,也未写明入选后对外公开性能结果的具体流程。
在当天的说明会上,韩国科学技术信息通信部也未披露是否会另行公布基准测试方案。对此,主管部门解释称,AI服务属于用户可以直接感知其表现的领域,相关竞争力最终会通过用户规模体现出来。
此外,项目周期偏短也被认为是一项现实挑战。按照目前安排,韩国科学技术信息通信部将在9月签署项目协议的同时推动测试版上线,并于12月推出正式服务,这意味着从企业入选到全面发布仅有约3个月时间。考虑到测试版的目标用户和运营方式同样可由企业自行设计,外界也担心,项目能否在有限时间内完成充分、有效的测试验证。
韩国科学技术信息通信部相关人士表示,政府希望推出性能“可对标海外免费版本”的“全民AI”服务;如果用户规模明显不足,后续也将通过年度评估重新遴选企业。“这也是今后需要持续研判的问题。”