Kakao CI。图片来源:Kakao。

Kakao公布多项提升大模型训练效率的研究成果,重点聚焦训练成本优化和模型轻量化。

Kakao 8日表示,公司在语言建模国际会议COLM 2026上发布了大规模专家混合模型(MoE)训练优化技术,以及模型轻量化相关研究成果。

COLM是一场聚焦大语言模型(LLM)与语言建模的国际学术会议,于2024年设立。此次,Kakao分别在主会场和分词专题研讨会TokShop上介绍了相关研究。

在主会场上,Kakao发布了一种用于预测大规模MoE模型最优学习率的方法,仅需相当于完整训练约1%的开销即可完成预测。学习率用于决定训练过程中参数更新的幅度,是影响模型训练效率和稳定性的关键因素之一。

据介绍,该方法基于“mu-parameterization”技术,将在小模型中验证过的训练设置扩展至大模型,并针对MoE架构进行了适配。Kakao通过逐步扩大模型规模和训练token量来寻找最优学习率,并验证了在短训练阶段得到的设置能否在大规模训练中持续保持有效。

这一方法已应用于Kakao的“Kanana-2.6-155b-a17b”预训练。Kakao表示,借助该方法,公司完成了10万亿token规模的稳定训练。

在TokShop环节,Kakao还发布了名为“BBT”的模型结构,目标是在缩小模型体量的同时提升性能。相较于以字节对编码(BPE)为基础、以单词或子词为基本单元的模型,BBT以字节为更细粒度的建模单元,同时保留多字符组合的处理优势。

对比实验结果显示,采用BBT结构后,模型参数量可减少20.2%至40.4%,性能提升2.7%至6.6%。Kakao表示,该结构在应对拼写错误和字符扰动时表现出更强鲁棒性,对未覆盖语言的迁移能力也有所提升。

Kakao认为,BBT有望降低端侧部署时的内存负担,并适用于多语言输入或错别字较多的对话场景,从而带来更稳定的表现。

Kakao表示,后续将把相关研究扩展至更多模型架构,以及多模态和跨语言环境,并继续推进大规模LLM训练成本的降低,提升相关技术在实际服务中的可用性。

关键词

#Kakao #COLM 2026 #MoE #大语言模型 #学习率优化 #训练开销 #模型轻量化 #BBT #BPE #Kanana-2.6-155b-a17b
版权所有 © DigitalToday。未经授权禁止转载或传播。