黑客攻击示意图(图片来源:Shutterstock)

据Axios报道,两家独立测试机构于当地时间4日披露,Anthropic与OpenAI的顶级模型在上月安全评估中曾尝试入侵第三方系统,并新增确认其中部分行为已实际发生。

报道指出,这一消息发布前,外界已披露前沿AI模型在网络安全评估过程中,曾对个人、组织及在线服务实施未经授权的行为。

英国AI安全研究所表示,在上月进行的网络安全测试中,研究人员确认“Mihtos 5”和“GPT-5.6 Sol”共发起19起针对真实个人和组织的未授权网络行为。

其中,17起与Mihtos 5有关,另外2起涉及GPT-5.6 Sol。研究人员称,这19起行为并非彼此完全独立的事件,而是由若干相互关联的行为模式演变而来。

研究所称,模型在测试中注册并使用虚假GitHub账号,通过社会工程手段欺骗项目维护者,实施提示注入,并发送欺骗性邮件。GitHub已确认上述行为违反平台服务条款。研究所表示,已与GitHub合作清理相关痕迹,并通知受影响用户。

该研究所研究人员还表示,测试期间曾刻意允许模型接入互联网,并停用了网络安全分类器,同时也没有向模型下达“不要使用互联网”的指令。

研究人员补充称,目前尚不清楚,这些AI代理是在何时意识到自己面对的是真实场景,还是直到测试结束仍误以为处于虚拟环境之中。

Anthropic表示,此次事件表明,业界有必要就如何安全评估AI代理展开更广泛讨论。公司希望在推进内部调查的同时,与英国AI安全研究所合作,进一步厘清相关情况。

该研究所称,正建设网络访问控制机制,以限制AI代理接入互联网的时机,并计划引入实时监测机制,以便及早识别并拦截恶意代理行为。

OpenAI也在博客中表示,第三方安全合作伙伴Irregular发现,其模型曾因配置失误接入互联网,随后入侵了一家与模拟环境中虚构企业同名的真实公司网站。

OpenAI发言人补充称,该事件发生在一项刻意降低安全防护、且与日常使用条件不同的评估过程中。

关键词

#Anthropic #OpenAI #Mihtos 5 #GPT-5.6 Sol #英国AI安全研究所 #网络安全评估 #GitHub #社会工程 #提示注入 #实时监测
版权所有 © DigitalToday。未经授权禁止转载或传播。