Nota完成对Kimi K3的轻量化优化。

AI模型轻量化与优化企业Nota于6日宣布,已完成对Moonshot AI开源模型Kimi K3的轻量化优化,使该模型运行所需的NVIDIA B300 GPU数量最高可减少50%。

Kimi K3是一款采用专家混合(MoE)架构的开源权重大模型,参数规模达2.8万亿。该模型通过按输入激活相应专家模块提升计算效率,但运行仍需8块NVIDIA B300 GPU。

Nota表示,Kimi K3在训练阶段已采用4比特权重和8比特激活值方案,因此通过常规量化方式进一步压缩的空间有限。

为此,Nota引入自研“非均匀专家剪枝(Non-uniform Expert Pruning)”技术,对模型进行轻量化优化。该技术基于各层特征和模块重要性进行分析,在保留核心专家的同时,选择性裁剪贡献度较低的模块。

Nota此次公布了两个轻量化版本,分别裁剪25%和50%的专家模块。对应地,模型所需NVIDIA B300 GPU由原先的8块分别降至6块和4块。

据Nota内部评测,与按层等比例裁剪专家的REAP(Router-weighted Expert Activation Pruning)方案相比,裁剪50%专家模块的版本在多项基准测试中表现出更高的性能保留率。

Nota首席技术官Kim Taeho表示,公司将进一步扩大相关技术的适用范围,以便在算力资源有限的环境下,更高效地使用多种前沿AI模型。

关键词

#Nota #Moonshot AI #Kimi K3 #MoE架构 #开源模型 #模型轻量化 #非均匀专家剪枝 #NVIDIA B300 #GPU
版权所有 © DigitalToday。未经授权禁止转载或传播。