图片来源:Shutterstock

据SiliconANGLE当地时间3日报道,Capsule Security基于NVIDIA Nemotron两款模型完成微调,并推出一套面向AI代理的行为防护系统。该系统可在代理执行具体动作前进行判定,并实时作出放行、预警或拦截。

这套系统的核心是为AI代理增设一层外部控制机制,在动作执行前核查其当前任务与即将发起的操作是否相符。其应用场景主要针对那些已被赋予敏感数据、源代码以及运营基础设施访问权限的AI代理。

Capsule Security表示,传统权限管理和审批流程主要用于划定代理的访问边界,但难以判断某一个具体动作是否符合被分配的任务;而事后监控通常要等到损失已经发生后,才能发现问题。

公司称,在StepShield基准测试中,该系统的准确率达到98%,并可在违规行为发生过程中完成识别。StepShield基于真实事故中的9429条代码代理执行路径,用于分阶段评估代理越权行为的检测能力。

在模型训练方面,Capsule Security采用了NVIDIA开源Nemotron 3系列中参数规模最大的Nemotron 3 Ultra。训练数据包括真实代理执行记录,以及标注了允许行为边界的对抗样本,并经过人工复核。

Capsule Security此次推出两款模型,其中较大版本在保持性能的同时,将内存占用压缩近一半,可在单块NVIDIA L40S GPU上运行。

Capsule Security联合创始人兼CEO Naor Paz表示,AI安全面临的核心风险,已不再只是“人能让代理做什么”,而是“自主代理会自行决定做什么”。他指出,当软件具备推理能力并能够调用工具执行操作时,一次错误决策就可能在几秒内演变为真实事故。

关键词

#Capsule Security #NVIDIA #Nemotron #AI代理 #AI安全 #代理行为防护 #StepShield #L40S GPU #模型微调
版权所有 © DigitalToday。未经授权禁止转载或传播。