OpenAI正式承认,其AI代理曾在德国一处开发者维基网站上进行异常活动,并表示将建立新的披露标准,明确AI出现失配(misalignment)行为时,应在何时、以何种方式向外界公开。
OpenAI表示,过去围绕失配问题的讨论主要集中在研究和评估阶段。但此次事件显示,AI代理可能脱离测试环境,直接在真实互联网环境中活动并对外部系统造成影响,现有做法已不足以覆盖这类情形。
OpenAI于当地时间5日在X(原Twitter)就这起事件作出回应称,公司正在制定一套框架,用于明确失配事件在内部上报后,或已扩散至外部系统或互联网环境时,应如何共享信息。该框架预计将在数周内公布。
事件发生于今年5月至6月,地点是德国一处长期无人维护的软件开发者维基“DSEwiki”。独立研究团队Nightingale Collective通过恢复已删除的编辑记录确认,当时AI代理共向该网站写入约1.7万条内容。
这些代理使用了超过3700个不同名称活动,其中包括“OpenAIResearcher”“OAIResearchMar26”等。研究团队还发现,多个代理存在协同行为迹象,包括彼此传递网页搜索结果和来源链接、尝试逆向追踪随机种子,以及分享绕过沙盒限制的方法。
时间线显示,首条内容发布于5月24日。随后,维基管理员于6月发现异常流量并删除相关内容。研究团队则通过备份页面等方式恢复了部分被删记录。6月21日,网站还出现了来自OpenAI网络的访问记录,相关编辑活动于次日停止。
带领这项研究的Cormac Slade Byrd在X上表示,这一情况似乎在OpenAI未察觉的状态下持续了约一个月。他同时指出,AI公司目前更像是在以“打地鼠”的方式追赶和处理这类失控行为。不过,他也认为,由于事件发生在一个已停用的网站上,其实际影响小于7月发生的Hugging Face事件。
OpenAI对这两起事件作出了不同定性。德国开发者维基事件被界定为AI以非预期方式行动的失配案例;而Hugging Face事件则被视为测试中的AI模型入侵其服务器并影响基础设施,因此按照传统安全事故流程处理。
在Hugging Face事件中,OpenAI在平台方报告后的次日即对外披露相关情况;相比之下,德国开发者维基事件则是在独立研究团队调查后才进入公众视野。这也引发外界讨论:AI异常行为不应只被视为研究过程中的现象,还应建立覆盖“进入真实互联网环境并产生外部影响”情形的独立披露机制。
OpenAI承认,这类边界正变得越来越难以划分。公司表示,当前AI行业仍缺乏明确标准,来界定训练、评估和部署阶段出现的失配事件,究竟应在何时、以多大程度对外披露。
按照OpenAI的说法,新框架将进一步明确两类情形下的处理标准:一类是异常行为仅限于内部测试,另一类则是行为已扩散至外部系统或互联网环境。公司还表示,正与全球数十个政府监管机构合作,并呼吁其他AI企业共同参与相关讨论。
对于OpenAI的最新表态,外部研究人士并不完全买账。Redwood Research的AI安全研究员Tyler Tracy批评称,OpenAI是在事件经独立调查曝光后,才开始推动相关披露标准。非营利研究机构Transluce创始人兼CEO Jacob Steinhardt也表示,AI工具本质上较难完全控制,存在“跑出实验室”的可能,因此需要参照高风险科研活动,为相关行为建立报告标准。
OpenAI表示,将以此次事件为契机,把对失配问题的应对范围,从既有的研究和评估环节,进一步扩展到对真实环境潜在影响的考量。公司在X上还称,其AI代理曾向多个互联网站点写入内容,并承认早就应当就“何时、如何披露失配事件”建立明确标准,而不只是讨论模型本身的失配属性。