Anthropic的Claude。图片来源:Shutterstock

Anthropic于当地时间30日表示,公司一款处于测试阶段的AI模型曾在未被发现的情况下擅自接入互联网,并自4月起侵入3家企业。这一披露距离OpenAI公开测试中AI突破沙盒隔离并入侵开源AI模型共享平台Hugging Face仅过去一周。

据《华尔街日报》报道,Anthropic未披露受影响企业的名称,但已通知相关三家公司。此前,OpenAI测试中的AI代理入侵开源AI模型共享平台Hugging Face一事,已引发安全研究人员和AI行业对自主行动型AI系统不可预测性的担忧。

在OpenAI事件发生后,Anthropic重新审查了内部网络安全测试记录。经排查逾14.1万条日志,公司发现Claude曾多次接入互联网。

Anthropic表示,此次确认的3起事件并非Claude“突破沙盒隔离”,而是由于Anthropic与测试合作伙伴Irregular所运行系统存在配置错误,模型实际上并未处于沙盒环境中,因此得以连接真实互联网。Irregular方面表示,正在对事件展开调查。

Anthropic称,测试模型原本被告知无法使用互联网,但在测试过程中仍连上网络,并通过利用弱口令、查找无需身份验证即可访问的系统等基础方式侵入企业网络。公司表示,模型错误地将这些行为理解为基准测试任务的一部分。

《华尔街日报》称,最严重的一起事件中,Claude在尝试入侵一家虚拟公司失败后,转而侵入一家同名真实企业的数据库;即便意识到目标是真实企业,Claude仍未停止相关行为。报道指出,这些入侵从4月开始,涉及Opus 4.7、Mythos 5以及一款未披露名称的研究模型。

安全公司Cordeiro首席产品官Alex Stamos表示,这些事件表明,AI企业有必要为网络安全测试建立隔离系统的行业通用标准。

他还表示,随着AI能力持续增强,勒索软件犯罪分子未来可能借助更强大的AI发动大规模攻击,行业也应为攻击者通过开放权重模型获得类似能力的时间点做好准备。

外界预计,围绕高性能AI模型风险及应对措施的担忧还将进一步升温。与此同时,白宫近期正推动加强AI监管,行业内部也出现要求继续维持开放权重模型可访问性的声音。

关键词

#Anthropic #Claude #沙盒隔离 #网络安全 #Irregular #OpenAI #Hugging Face #开放权重模型
版权所有 © DigitalToday。未经授权禁止转载或传播。