搜索关键词 ICML 2026
AI & Enterprise
KAIST推出LLM红队新框架,漏洞类型识别能力提升约7倍
KAIST研究团队发布面向大语言模型安全测试的红队框架Stable-GFlowNet。该框架通过引入“对照轨迹平衡”等机制提升训练稳定性,在将攻击成功率维持在92%的同时,识别出134种攻击类型,较现有方法的17种提升至约7倍。基于该框架训练的防御模型在交叉攻击测试中也展现出更好的防护能力。
AI & Enterprise
KAIST发布Buffer-and-Reinforce框架 提升大模型定制化微调安全性
KAIST研究团队提出两阶段学习框架Buffer-and-Reinforce,旨在解决大语言模型基于企业或个人数据进行定制化微调时安全对齐易被削弱的问题。该方案先通过BufferLoRA在训练阶段隔离恶意数据影响,再利用ReinforceLoRA结合QR分解定向增强安全能力。实验显示,在用户数据全部由危险问题及回答构成的极端环境下,模型生成危险回答的比例仍可控制在约8%,明显低于基线模型约18%的水平。
AI & Enterprise
Team Naver亮相ICML 2026,集中展示大语言模型安全与物理AI研究成果
Team Naver在首尔COEX举行的ICML 2026上集中展示多项AI研究成果,涵盖大语言模型安全、模型与智能体运行效率,以及3D空间理解与物理世界扩展等方向。其中,基于Stable-GFlowNet的大语言模型红队测试研究入选Spotlight;SyMerge、FlowBot和“Seoul World Model”等项目也同步亮相。