AI模型轻量化与优化企业Nota于6日宣布,已完成对Moonshot AI开源模型Kimi K3的轻量化优化,使该模型运行所需的NVIDIA B300 GPU数量最高可减少50%。
Kimi K3是一款采用专家混合(MoE)架构的开源权重大模型,参数规模达2.8万亿。该模型通过按输入激活相应专家模块提升计算效率,但运行仍需8块NVIDIA B300 GPU。
Nota表示,Kimi K3在训练阶段已采用4比特权重和8比特激活值方案,因此通过常规量化方式进一步压缩的空间有限。
为此,Nota引入自研“非均匀专家剪枝(Non-uniform Expert Pruning)”技术,对模型进行轻量化优化。该技术基于各层特征和模块重要性进行分析,在保留核心专家的同时,选择性裁剪贡献度较低的模块。
Nota此次公布了两个轻量化版本,分别裁剪25%和50%的专家模块。对应地,模型所需NVIDIA B300 GPU由原先的8块分别降至6块和4块。
据Nota内部评测,与按层等比例裁剪专家的REAP(Router-weighted Expert Activation Pruning)方案相比,裁剪50%专家模块的版本在多项基准测试中表现出更高的性能保留率。
Nota首席技术官Kim Taeho表示,公司将进一步扩大相关技术的适用范围,以便在算力资源有限的环境下,更高效地使用多种前沿AI模型。
记者信息