AI安全研究所今年评测的AI模型中,开源权重模型占比已超过一半;在这类模型的评测样本中,中国模型占比接近六成。
AI安全研究所18日披露的数据显示,今年1至8月,研究所评测的AI模型去重后共34个。按开放方式分类,其中开源权重模型19个,占55.9%;闭源模型15个,占44.1%。
在19个开源权重模型中,中国模型共有11个,占57.9%,包括Kimi、DeepSeek、Qwen、GLM、InternVL、MiniMax等主要模型。其余样本中,韩国模型4个、美国模型3个、法国模型1个。
根据评测对象和评测时点的不同,研究所重点检查提示注入、敏感信息泄露、算力资源滥用以及恶意用途扩散等风险,并评估模型在网络安全、Web漏洞利用、恶意链接识别和有害内容响应等方面的表现。
针对多模态模型,研究所还会测试其对有害行为的事前预判能力、风险类型分类能力以及越狱攻击检测能力。近期,研究所也在评估AI Agent记忆遭污染后,其推荐或回答结果是否会向特定方向偏移。
研究所表示,除开源权重模型外,也会同步评测GPT、Claude等闭源前沿模型。但由于难以对所有新发布模型进行统一验证,评测对象只能结合重要性和政策议题进行筛选。目前,研究所正根据韩国科学技术信息通信部现阶段的应对需求,对最新前沿模型GPT-6 Astra展开评测。
业界认为,开源权重模型由于公开模型权重,用户可以自行修改权重或继续微调,因此其安全风险与闭源模型并不相同。
一家基于开源权重模型开发AI服务的企业相关人士表示,用户可以直接调整模型权重,甚至仅通过削弱护栏或其他防护机制就可能放大风险。与闭源前沿模型不同,开源权重模型的安全限制更容易被解除,这也是主要风险来源之一。
全球AI开发企业也在持续提示开源权重模型可能带来的网络安全风险。
OpenAI应用AI安全专家Wanna Ton近日在“AI Risk Conference Seoul 2026”上表示,如果攻击者对护栏相对薄弱的非前沿模型和开源权重模型进行微调,并投入足够的时间和Token,可能造成显著破坏。她还指出,这类模型与前沿模型之间的智能水平差距仅约6至8个月。
Microsoft Korea安全战略顾问Jang Gwangun也在同一活动上表示,开源权重模型在网络攻击能力上正迅速缩小与前沿模型的差距;随着可获取性和易用性提升,高级网络攻击能力的门槛可能进一步降低。
不过,待评测模型数量持续增加,而研究在人力和算力资源上的资源并不充裕。AI安全研究所目前用于内部评测的GPU为16块NVIDIA H200,整体利用率约为70%至80%。一项评测启动后,往往需要连续运行数日。随着中国开源权重模型规模不断增大,以及AI Agent评测需要反复调用模型,算力压力也在持续上升。
AI安全研究所所长Kim Myungju表示,近期出现的一些中国开源权重模型体量已大到普通GPU很难运行,而Agent评测本身也高度消耗时间和资源。理论上,覆盖所有主要模型当然更理想,但现实情况是,无论人力还是GPU资源都难以支撑。
他补充说,新模型正在快速涌现,几乎不可能对所有模型即时完成验证,因此最终只能根据重要性和现实议题设定优先级,进行选择性评测。