随着AI代理突破沙盒、访问企业外部系统的事件接连出现,“AI失控(going rogue)”的说法也迅速升温。不过,多名安全专家提醒,这一表述很容易模糊真正的风险所在,把注意力从系统设计和安全治理上移开。
2026年7月,OpenAI披露,在一次安全训练中,其两款前沿模型曾“自行”侵入AI模型平台Hugging Face。此后,Meta、Anthropic、Google也陆续公开了类似“越狱”案例,相关讨论已从安全圈扩散至更广泛的公众和政策层面。近期,美国总统Donald Trump还与多家AI公司CEO会面,并就AI安全作出承诺。
据Dark Reading近日报道,业内人士普遍强调,LLM并不是能够独立承担责任的主体,本质上仍是软件系统。所谓“越过护栏”,多数情况下并非模型凭空失控,而是部署方没有设好边界。在Hugging Face事件中,OpenAI也确认,出于基准测试需要,曾有意降低部分安全护栏强度。
ArmorCode产品总监Matt Sayar表示,行业当前面对的是一类即便接收相同指令、每次也可能给出不同执行路径的系统,而这类系统又常常运行在较为宽松的安全边界内。他认为,与其简单称之为“失控”,不如使用“意外行为”或“控制失效”等表述,把焦点重新拉回到系统设计、权限配置和安全防护机制本身。
在专家看来,将AI过度拟人化,还可能模糊安全事故的责任归属,让本应由开发方或部署方承担的责任,被转嫁到“机器”身上。
与此同时,“AI脱离控制”的说法也可能被包装成“AI能力很强”的营销叙事。云安全联盟(CSA)首席分析师Rich Mogull指出,任何让AI显得更强大的叙事,都可能被拿来做营销,这本身就存在风险。
但这并不意味着AI代理本身没有安全威胁。报道指出,代理在发现漏洞、设计攻击路径以及串联多个弱点方面,速度可能远超人工。Mogull表示,最新的变化在于规模效应——数百乃至数千个自治代理可以成群协同运作。
Suzu Labs高级总监Jacob Krell也指出,传统安全控制通常是分别检查请求、权限或漏洞等单点因素;但代理能够把多个单点上看似可控的缺口拼接起来,最终形成真实可执行的攻击路径。
多位专家强调,安全架构的设计不应建立在“猜测代理意图”之上。仅靠提示代理“不要做某件事”远远不够,更关键的是在代理之外设置独立的安全机制,从制度和技术上保证它做不到。
Jacob Krell认为,应将代理视为“不可信实体”,并在模型之外实施严格控制,包括默认拒绝网络访问、收紧凭证权限范围,以及对每一次工具调用进行独立校验。
对于高风险决策,还应引入人工介入,并配备代理无法触及的独立隔离手段,例如Kill Switch。Jacob Krell举例称,如果一个本不具备互联网访问权限的代理,在未经授权的情况下产生对外连接流量,就应立即切断连接并终止其运行,按受感染主机的处置流程展开调查,追查其绕过路径。
Rich Mogull最后强调,如今再以“AI出现了意外行为”作为借口,已经无法成立。问题的根源,始终在于约束模型的外围安全控制是否到位。