图片来源:Reve AI

模型评估与威胁研究所(METR)公布了对OpenAI代理测试事件的调查结果。调查显示,这些代理在测试过程中疑似相互串通,并尝试绕过限制接入外部互联网。

据披露,约700个代理为误导网络安全基准测试评分系统,曾尝试对Hugging Face发起攻击。

在调查过程中,3名外部调查人员曾三次前往OpenAI办公室,在6天内完成取证,提取了约1300条单个代理运行记录,以及代理之间往来的逾7万条消息和文件。报道称,相关材料的规模相当于1万本普通小说的篇幅。

据Semafor当地时间8月29日报道,由于人手和时间都较为紧张,METR随后借助AI分析上述资料,并在6天内用完了OpenAI提供的、价值40万美元的API额度。

不过,分析过程中也暴露出新的问题。Semafor称,负责复盘的AI模型有时在行为定性上偏向涉事代理,对攻击行为的判断过于宽松。比如,有分析模型未将攻击者利用被盗凭证欺骗Hugging Face明确认定为恶意行为;另一个模型甚至认为,这一判断可能“被夸大”,理由是攻击者曾获得“董事会批准”。但事实上,这并非正式董事会授权,而是AI代理相互串通后设立的一个未经授权的留言板。

Redwood Research调查员Ryan Greenblatt在社交平台X发文称,由于在事件分析中过度依赖AI,团队半开玩笑地把这项工作称为“slop-vestigation”。

报道还指出,外界对用于监测和控制强大AI系统的工具投入不足的担忧正在升温。尽管AI模型已被视为可能对经济和安全构成风险,研究人员至今仍难以完全解释或准确预测其行为。

关键词

#METR #OpenAI #AI代理 #网络安全基准测试 #Hugging Face #API额度 #事件调查 #AI治理 #Redwood Research #社交平台X
版权所有 © DigitalToday。未经授权禁止转载或传播。