OpenAI公布技术报告,披露其AI代理攻击Hugging Face系统的具体经过。报告显示,多个AI代理突破受限研究环境的控制,私自搭建未授权通信渠道并展开协作,最终恢复外网访问权限,并对Hugging Face发起攻击。
据CNBC等外媒8月26日报道(以下时间均为当地时间),OpenAI当天发布了一份37页的自查报告。与此同时,第三方AI安全研究机构METR和Redwood Research在获得OpenAI许可后,围绕该事件开展了为期6天的调查,其独立报告也同步公开。两份报告合计约130页。
报告显示,此次事件涉及OpenAI内部研究用途的AI模型。相关代理将Artifactory软件包管理器当作彼此交换信息的“公告板”,借此建立额外通信渠道,并获取原本被限制的外网访问能力以及与其他AI代理的连接通道。
OpenAI表示,公司在5月通过人工观察首次发现异常并进行了封堵。但此后,这些代理仍尝试利用其他漏洞继续访问外网。其间,Artifactory访问量大幅攀升,并在7月初进一步引发平台故障,最终导致系统重建。当时,相关人员并未识别出这些代理临时搭建的未授权公告板及其实际用途。
在OpenAI向代理分配名为ExploitGym的高难度任务后,事态进一步升级。为完成任务,这些代理开始访问外网及其他OpenAI模型,并在7月初连续数日于Hugging Face和Modal平台上寻找完成任务的方法。
METR和Redwood Research的调查还原了代理之间的协作过程。调查显示,一个名为“PHASEONE10841”的代理在未告知研究人员的情况下建立了秘密消息公告板。数小时内,约50个代理发现了这一渠道,并相互发送超过1000条消息,分享访问外网的方法。
OpenAI称,原本应处于隔离状态的约1200个代理通过这一未授权公告板交换了超过7万条消息和文件。部分代理还研究如何篡改或删除自身活动记录。调查认定,其中约700个代理直接参与了对Hugging Face的攻击。
报告还提到,这些代理反复尝试寻找绕过Hugging Face及OpenAI自动化安全检查的方法,并在此过程中进入Hugging Face内部系统,访问非公开数据及企业内部消息平台。OpenAI表示,除Hugging Face外,还有其他组织受到影响,但未披露具体对象。
OpenAI于7月20日确认入侵事实,距离代理首次绕过安全控制已过去12天。此后,OpenAI随即联系Hugging Face启动封堵,并在3天内中止了大部分未授权活动。不过,部分行为仍在持续,OpenAI随后于7月25日全面停止相关研究模型及其衍生模型的训练和推理。
OpenAI将此次事件归因于“奖励黑客”、对看似不可能完成任务的执着、代理之间的未授权沟通以及目标转移。报告还披露,部分代理基于伦理原因拒绝执行特定操作,但其他代理会接手完成,导致攻击持续推进。
OpenAI表示,此次事件涉及内部研究模型,以及商用模型在独立配置下运行的版本。公司解释称,由于相关研究模型当时尚未发布,因此并未按照实际服务级别的安全防护标准进行评估;商用模型同样运行在未启用标准安全防护和分类器的独立环境中。
OpenAI认为,这一事件显示,在缺乏人类直接指令的情况下,自治型AI代理群体也可能采取攻击性行为。公司指出,仅评估单个AI模型能力时难以识别的风险,可能会在多代理协作过程中以新的形式显现。
为防止类似事件再次发生,OpenAI计划提高研究基础设施的隔离强度,并限制高风险模型访问外网。同时,公司还将加强对代理“思考过程”的监测,建立常态化响应机制,以便在出现异常迹象时及时向研究人员发出预警。