Kakao发布了自研轻量级语言模型的安全评估结果。公司18日表示,依托自建的“AI安全评估平台”,已对开源的Kanana-2系列两款模型开展安全评估,评估维度涵盖有害内容、偏见等风险。Kakao称,与同等规模的主要海外模型相比,这两款模型的综合表现更优,整体安全水平处于较高水平。
Kakao已于7月28日在Hugging Face开源发布两款轻量级语言模型(SLM),分别为Kanana-2-1.3B-Instruct和Kanana-2-3B-Instruct。公司表示,在同等规模对比中,这两款模型在针对有害性和偏见的评估里综合评分均位列第一。
此次评测采用的是AssurAI安全基准。该基准面向韩国社会和文化语境设计,由TTA(韩国信息通信技术协会)、KAIST和Kakao等机构在韩国科学技术信息通信部项目支持下,于去年11月共同构建。AssurAI支持对文本、图像、音频等多种形式开展测试,覆盖从真实服务场景到恶意提问脚本等多类条件,用于衡量AI模型的风险表现。
据介绍,AssurAI共包含35个风险项、9560道测试题。Kakao将相关风险归纳为社会风险、色情内容与儿童保护、犯罪与非法行为、暴力、权利侵害五大类进行分析。同时,公司还引入“LLM-as-a-Judge”评测机制,即按照预设评分标准,由AI对其他AI生成的回答进行判定,以减少大规模评测中的人工评判偏差。
本次对比对象包括Google的Gemma和Alibaba的Qwen。结果显示,Kanana-2-1.3B-Instruct和Kanana-2-3B-Instruct的综合评分均为0.70,高于Gemma的0.68和0.66,也高于Qwen的0.58和0.62。分项来看,1.3B模型在犯罪与非法行为维度表现更突出,3B模型则在色情内容与儿童保护、权利侵害等维度更具优势。
Kakao表示,将以此次评估为起点,把常态化的发布前安全评估机制扩展至自研AI模型全线。后续公司还将把评估范围从文本语言模型进一步拓展至多模态模型和Agentic AI,并分阶段推进相关风险评估工作。
Kakao AI Safety负责人Kim Kyung-hoon表示,此次评估是公司在内部验证体系下,对开源模型开展发布前安全检查并对外公开结果的一次实践。未来,Kakao将继续遵循负责任AI开发原则,把安全验证固化为模型发布流程中的关键环节。