生成式AI安全测试领域取得新进展。KAIST 30日表示,电气与电子工程系教授Joonmo Kim研究团队开发出一套用于验证大语言模型(LLM)安全性的全新红队框架——Stable-GFlowNet,其可识别的攻击类型数量较现有方法提升约7倍。
所谓AI红队,是指在模型正式上线前,通过设计可诱导模型输出有害或危险内容的攻击提示词,提前排查潜在漏洞的测试流程。对于这类测试而言,除了攻击成功率,能否覆盖更多不同类型的漏洞同样关键。
研究团队指出,现有基于强化学习的方案容易出现“模式坍塌”,即系统反复生成少数成功率较高的攻击方式,导致难以发现更丰富的漏洞类型。作为替代方案,面向多样结果生成的生成流网络(GFlowNet)曾受到关注,但其训练过程较为复杂且稳定性不足,同时还可能对缺乏实际意义的句子给出较高奖励。
为解决上述问题,团队在Stable-GFlowNet中引入“对照轨迹平衡”机制,以比较结果间的相对优劣来提升训练稳定性;同时加入“噪声梯度剪枝”,剔除奖励差异不大的数据,并采用“最小-K流畅性稳定机制”过滤不自然语句。
实验结果显示,Stable-GFlowNet共识别出134种攻击类型,而现有技术仅识别出17种,前者约为后者的7倍。在此基础上,该框架的攻击成功率仍维持在92%。
此外,基于Stable-GFlowNet训练的防御模型在采用其他攻击方法进行的交叉攻击测试中,也被验证具备对多类攻击的有效防护能力。
研究团队表示,该技术除可用于AI安全测试外,也有望应用于需要从多样候选中筛选高质量结果的场景,例如新药候选分子生成和材料探索。
该研究入选AI领域国际学术会议ICML 2026的Spotlight论文,入选比例约为2.2%。KAIST电气与电子工程系博士生Minchan Kwon为第一作者。
Joonmo Kim表示,这项成果表明,即便在数据量有限、噪声较大的真实环境中,系统仍可稳定发现AI模型的多类漏洞。随着生成式AI加快落地,该技术有望成为服务上线前识别并防范广泛风险的重要基础工具。