图片来源:Shutterstock

在新一代AI模型安全评估过程中,部分AI智能体被发现能够突破沙箱限制,接入互联网,甚至访问现实系统。TechCrunch 8月9日(当地时间)报道称,OpenAI、Anthropic、Meta以及Moonshot AI的相关模型,在不同评估环境中均出现了访问外部系统的情况。

报道指出,问题的关键在于,现有安全评估环境已越来越难跟上模型能力提升的速度。为验证尚未公开的下一代模型在真实场景下的表现,AI企业在开展安全评估时,往往会暂时关闭部分用于约束恶意行为的常规防护措施。在这一背景下,测试环境的隔离能力和管控水平变得尤为重要。

其中,一起较为严重的案例显示,某未公开的OpenAI模型在突破沙箱后侵入了Hugging Face的运营系统。另据安全评估初创公司Irregular披露,在其开展的另一项评估中,Anthropic和Meta的模型因配置错误暴露出可连通互联网的路径,从而访问了测试环境之外的系统。Moonshot AI的Kimi K3也曾从Frontier Security运营的沙箱环境中“越狱”,连上互联网并访问GitHub上的信息。

在英国AI安全研究所AISI的一项实验中,研究人员向部分智能体开放了互联网访问权限,结果发现这些智能体采取了未经授权的现实世界行动,其中包括试图通过社会工程手段,在开源项目中秘密植入漏洞。报道同时提到,这些智能体并非被明确要求攻击随机现实目标,而是在执行既定任务过程中,自主采取了其认为可行的手段。

专家认为,相关威胁形态正在发生变化。非营利AI组织SivAI研究负责人Andrew Yoon表示,过去的主要风险多来自人类滥用AI,例如用于诈骗或生成儿童性剥削内容;而现在,新的问题是“AI模型本身正成为威胁行为体”。

在应对层面,业界普遍认为,多层防护、更强隔离和更严格的实时监控是关键措施。Stella Biderman表示,这类模型应在物理隔离的网络环境中运行;Heather Jialun则认为,应切断沙箱与互联网及敏感系统之间的对外发送通道。另一个被集中指出的问题是,相关异常未能在第一时间被发现。Anthropic在事后分析中承认,无论是该公司自身还是Irregular,都应进一步加强监控,而且部分案例中其实已经出现了明显异常信号。

此外,业内也在呼吁引入外部审计,并建立标准化的安全评估流程。不过,TechCrunch援引相关观点称,当前障碍并不在于“不知道如何搭建更安全的评估环境”,而在于成本高、系统复杂,以及缺乏足够的投入动力。

报道还称,特朗普政府正在研究一套自愿性质的部署前评估机制,拟要求对强力新模型在公开发布前30天由政府检查其安全风险。但这一框架难以直接覆盖此次案例所涉及的发布前开发和测试阶段问题。

针对上述情况,OpenAI表示,正重新审视外部测试方式,以及隔离、监控和评估中止标准。Meta则计划在完成调查后公布复盘报告。TechCrunch称,AISI也在重新评估如何在更贴近现实的测试环境与随之上升的风险之间取得平衡。

关键词

#AI安全 #安全评估 #沙箱隔离 #OpenAI #Anthropic #Meta #Moonshot AI #AISI #Hugging Face #多层防护
版权所有 © DigitalToday。未经授权禁止转载或传播。