韩国“独立AI基础模型”项目四支团队(示意图)

韩国政府推动的“独立AI基础模型”项目已进入二次评估阶段。参与项目的四支团队在模型扩容路径上出现明显分化:LG AI研究院和SKT继续提升参数规模,模型体量已逼近全球主流开源大模型;Upstage和Motif Technologies则把重点放在长文本处理、Agent任务能力以及推理效率上。

据业内消息,Motif Technologies已于8月3日提交二次评估成果报告。至此,此前已提交材料的LG AI研究院、SKT、Upstage,加上Motif Technologies在内,四支团队均已完成二次评估材料提交。

从技术路线看,四支团队均采用专家混合(MoE)架构。该架构通过在模型中设置多个“专家”模块,在处理任务时只激活其中一部分,以在扩大模型总容量的同时控制实际计算开销。

因此,MoE模型的规模通常需要同时看两个指标:一是反映整体体量的总参数,二是模型在实际推理过程中调用的活跃参数。

在四支团队中,两家大企业均推出了600B以上模型。作为对照,全球同量级模型中,DeepSeek R1总参数为671B,活跃参数为37B。LG AI研究院的K-EXAONE 2.0总参数达到750B,活跃参数约为37B;SKT的A.X K2总参数为688B,活跃参数为33B。

两家初创公司则选择了约300B规模路线。Upstage的Solar Open 2总参数为250B,活跃参数为15B;Motif 3 Preview Beta总参数为314B,活跃参数约为13B。其体量与今年4月公开的DeepSeek V4 Flash Preview(总参数284B、活跃参数13B)相近。

LG AI研究院:基于前代模型扩容,参数规模提升至三倍以上

在四支团队中,LG AI研究院的扩容力度最大。K-EXAONE 2.0的总参数较第一阶段模型的236B提升逾三倍。

从模型结构看,LG AI研究院将负责分层处理信息的计算层数从48层增加到78层,并将每个MoE层中的专家模块数量从128个扩展至256个,活跃参数也从23B提高至37B。

LG AI研究院采用了“upcycling”方式,即以旧模型训练形成的权重作为新模型的起点。该公司表示,这一方法有助于在保留前代模型知识的同时,进一步提升模型的计算深度和总体容量。

从其自评结果看,K-EXAONE 2.0整体性能有所提升。该模型在24项评测指标上的平均分为70.1分,高于第一阶段模型的63.3分,增幅超过10%;在编码与Agent式编程相关的3项核心指标上,平均性能提升约30%。

LG AI研究院计划以本次模型为基础,在下一阶段推进万亿参数级模型研发。

LG AI研究院联合研究负责人Lim Woohyung表示,韩国本土研究团队已独立完成从750B级模型设计、数据训练、分布式训练到推理环境搭建的全流程,具备在与全球前沿模型同一量级上展开竞争的能力。

SKT:总参数增至688B,活跃参数维持不变

SKT在第二阶段将A.X K2的规模较第一阶段提升约30%,同时把重点放在降低推理服务的计算和内存负担上。该公司通过增加专家数量,将总参数从519B扩展至688B,但每个token对应的活跃参数仍维持在33B。

在训练数据方面,SKT更强调数据质量而非单纯追求数据规模。第一阶段模型训练使用了10万亿token,而A.X K2约使用8.5万亿token,不过在训练后期加大了高质量、高难度数据的投入。

在长文本处理方面,SKT引入了自研的“稀疏门控注意力(SGA)”机制,仅选择与当前问题相关性更高的信息进行调用,而不必对全文进行等权重复检索,从而在输入长度增加时降低处理负担。

根据A.X K2技术报告,在引入SGA后,模型长文本理解得分基本保持在相近水平,但长输入场景下的处理速度有所提升,无论是首个输出时间还是后续token生成速度,均较第一阶段模型有所改善。

SKT计划在后续继续向万亿参数级扩展,同时推进量化以及国产神经网络处理器(NPU)优化。量化后的A.X K2,其推理服务所需内存约为A.X K1的三分之一。

SKT相关人士表示,当前开源模型中参数超过1万亿的案例正不断增加,如要参与全球竞争,仍需持续开发更大规模模型;与此同时,通过量化等方式提升服务效率,也能缓解模型扩张带来的资源负担。

Upstage:突出100万token上下文与Agent实用性

Upstage表示,Solar Open 2在支持最高100万token上下文窗口的同时,也降低了长文本处理成本。其将用于压缩既有上下文的线性注意力,与用于更精细计算词间关系的Softmax注意力结合使用。公司称,与在所有层中仅采用传统注意力机制相比,所需内存和计算量可降至约四分之一。

Upstage还将韩语分词器视为自身优势之一。该公司表示,在其自研的韩语办公任务评测输入中,单个token可承载4.41字节韩语信息,较对比的全球模型中效率最高者高出约24%。这意味着在处理同一份文档时,可使用更少token,有助于降低长时对话及工作记录持续累积场景下的成本。

在AI Agent能力方面,Upstage将工具使用、编码、文档写作等任务分别训练得到的12个专用模型结果进行统一整合,以提升模型在多轮推理和多次工具调用场景下的任务完成能力。

根据Upstage内部评测,在9项韩语基准测试中,Solar Open 2平均得分为85.4分,略高于DeepSeek V4 Flash Preview的84.9分。在英文评测中,两者在知识与推理、编码、Agent等项目上各有胜负。Upstage表示,其模型在相近参数规模下进一步强化了韩语能力和实际业务执行能力。

Upstage CEO Kim Seonghun表示,Solar Open 2并非只追求基准测试成绩,而是更强调在真实工作场景中自主完成任务的Agent可用性。

Motif:以自研架构提升效率,314B模型对标更大体量产品

Motif将模型架构设计效率视为差异化优势。在本次二次评估模型之前,该公司公开的Motif 3 Beta曾在全球AI评测机构Artificial Analysis汇总9项评测形成的综合指标AAII中获得44分,与总参数1.6万亿、体量约为其5倍的DeepSeek V4 Pro(Max)持平。

Motif 3 Beta在314B总参数中,仅激活约13B参数。相比DeepSeek V4 Pro的49B活跃参数,其生成答案时实际调用的规模约为后者的四分之一。该公司表示,模型以更小体量和更低活跃计算成本取得了相同综合得分。

Motif强调,这一结果来自“从零开始”的研发路线:没有引入海外开源模型结构,而是从模型架构起步自主研发并完成从零训练。公司介绍称,约30名研究人员使用约700块GPU,在5个月内完成了预览版模型开发。

不过,上述成绩基于中间阶段模型,并非此次提交二次评估的最终版本,最终提交模型的性能目前尚未公开。

Motif Technologies CEO Lim Jeonghwan表示,预计最终模型相较Beta版本将进一步提升;当前成果仍是迈向全球领先模型过程中的中间阶段。公司将继续推进研发,提升模型性能,并在全球市场验证韩国AI技术的竞争力。

根据安排,韩国政府将综合基准测试、专家评审以及由200人组成的公众评估团用户测评结果,从四支团队中选出三支进入下一阶段。公众评估团测评将于8日至11日进行。

关键词

#韩国独立AI基础模型 #MoE #LG AI研究院 #SKT #Upstage #Motif Technologies #K-EXAONE 2.0 #A.X K2 #长文本 #上下文窗口 #量化
版权所有 © DigitalToday。未经授权禁止转载或传播。