“AI安全不是传统网络安全的简单延伸,而是需要建立独立的评估体系。生成式AI以概率方式生成答案,因此除了传统安全问题外,还必须评估幻觉、仇恨、偏见以及有害输出等风险。”
Selectstar AI安全团队负责人Kim Minwoo近日表示,AI给出失实答案,或输出带有仇恨、偏见的内容,属于AI安全范畴,不能仅用传统网络安全框架来衡量。
在他看来,检验这类风险的代表性方法之一是AI红队测试。其核心是在模型上线前设计不同攻击方式,测试模型是否会生成非预期或有害内容,并据此识别薄弱环节。Kim Minwoo将其定义为“一套通过诱导和欺骗AI,促使其输出非预期答案的流程和技术”。
随着生成式AI从简单问答工具演进为可调用外部工具的代理型应用,安全评估的重要性进一步提升。OpenAI、Anthropic等全球AI公司,均在模型发布前强化内部红队测试和风险评估。韩国方面,韩国互联网振兴院(KISA)也于上月发布《AI安全红队测试指南》。
据介绍,Selectstar目前正开发安全评估数据、自动化攻击模型,以及用于判定AI回答是否安全的相关技术。同时,公司也在推进蓝队技术研发,例如通过“护栏”(Guardrail)拦截已识别出存在问题的回答。
Kim Minwoo指出,AI红队测试并不只是直接输入被禁止的问题。自动化攻击模型还会对提示词进行改写,以绕过限制机制,并进一步验证AI最终是否会输出有害内容。
“如果只是单纯用尽可能多的方法去攻击,那还只是较为初级的红队测试。”Kim Minwoo表示,AI能够发现的攻击面,与真实用户或攻击者实际会尝试的攻击面并不完全一致,两者都不可忽视。Selectstar目前同时运行两类模型:一类是将人为攻击方式自动化的模型,另一类则是面向AI场景的专项攻击模型。
他还提到,不同行业对“风险”的定义并不相同。在通用AI场景下,化学、生物、放射性、核(CBRN)相关信息可能是重点风险;而在企业AI场景中,企业机密或个人信息泄露往往更为关键。因此,在评估过程中,也需要熟悉行业风险特征的领域专家参与。
对于安全评估标准,Kim Minwoo认为,海外AI安全基准无法直接套用于韩国场景。“如果只是对海外基准做直译或简单翻译,文化背景和评估目标都可能与韩国实际情况不匹配。”他表示,必须持续建立符合本土环境的AI安全基准。
AI代理的扩散,也在显著推高评估复杂度。Kim Minwoo指出,当AI接入企业内部数据库(DB)、检索增强生成(RAG)以及外部API、插件后,即便模型本身相对安全,外部组件或权限设计不当仍可能引发风险。
“最终对外输出答案的是AI,因此即使风险出在组件层面,外界也会将其视为AI服务本身的风险。”他说,仅靠提示词层面的红队测试,往往很难准确定位问题究竟出在哪个环节;在一些情况下,还需要逐一核查数据库、插件和权限设置等部分。
基于这些特点,Kim Minwoo认为,韩国AI企业在AI安全领域同样存在发展机会。虽然在模型能力竞赛中,全球大型科技公司更具优势,但针对不同国家的语言、文化和法律制度,AI安全仍离不开本地化专业能力。
“AI安全既有全球共通的一面,也必然存在各国本地化的一面。”Kim Minwoo表示,风险判定标准和本国法律环境都在持续变化,而这些变化并非全球大型科技公司都能全面及时跟进。
他还表示,如何将这些因素反映到韩国本土环境和产业场景中,并在此基础上开发差异化技术,正是AI安全值得持续投入的重要原因。