德国AI初创公司Aleph Alpha推出大语言模型Kolibri,瞄准公共管理、工业制造、航空航天等高监管行业。
日本媒体GIGAZINE报道称(当地时间10月6日),Aleph Alpha已于10月3日德国统一日正式公布Kolibri。该模型采用专家混合(MoE)架构,总参数量达781亿,推理时仅激活约34.6亿参数,支持英语和德语,上下文窗口最高可达100万token。
Aleph Alpha将安全与合规要求较高的行业视为Kolibri的重点市场。公司表示,在数学、编程、长文本处理和代理型任务等内部基准测试中,Kolibri的表现接近部分开源权重模型,而这些模型的激活参数规模最高可达其4倍。不过,上述结论基于该公司披露的内部测试结果。
“主权AI”是Kolibri的核心定位。Aleph Alpha表示,该模型在德国开发,并依托德国和芬兰的基础设施完成训练;从数据筛选到预训练、后训练及优化,均通过公司自有流程完成。Kolibri还支持客户在自有环境中部署,以便根据自身需求调节成本、时延和推理性能。
为降低幻觉,Kolibri引入了Aleph Alpha自研的Merlin-Arthur训练方法。按照公司的说法,当现有资料不足以支撑答案时,模型会被训练为不强行作答。公司称,这一机制有助于提升高监管行业场景下回答的可追溯性和有据可依程度。
Kolibri也着重强化了德语能力。该模型的预训练语料总规模达到20万亿token,其中21.3%为德语内容;同时,Aleph Alpha还分别开发了德语和英语专用tokenizer,并降低了对翻译数据的依赖。
目前,Kolibri的模型权重和配置文件已在Hugging Face上以Apache 2.0许可证开放,但其训练代码、模型架构以及完整训练方法尚未全部开源。