Mistral AI发布了一款名为Shieldstral的轻量级多模态安全模型,主要用于对AI模型的输入输出进行安全审查。SiliconANGLE于当地时间5日报道称,该模型采用开放模型权重,开发者可在运行时通过自然语言设定审查策略,模型则会给出安全评分,并返回“是”或“否”的判断结果。
据介绍,Shieldstral可在无需重新训练的情况下同时处理文本和图像内容。开发者首先可以输入包含安全评估目标和判定标准的系统级指令,随后再输入用户提问及需要检查的内容。
Mistral AI表示,Shieldstral并不是靠记忆审查规则的字面表述来工作,而是经过训练后能够区分彼此接近但并不相同的标准。以公司给出的示例来看,模型可以区分“是否涉及恶意代码”与“是否属于网络安全讨论”这两类要求,即使仅触犯其中一项,也能作出识别。
在性能方面,Mistral AI强调,Shieldstral在轻量级模型中表现突出。公司称,在多项安全基准测试中,Shieldstral的文本安全评分平均达到84.9%,与参数规模超过其7倍的模型相比相当甚至更高;在多模态图像安全基准测试中,其平均得分为83.8%,在相关评测模型中处于领先水平。
记者信息