OpenAI当地时间7日通过官方博客表示,已暂停尚未发布的AI模型Astra的部分开发工作。
OpenAI称,内部评估显示,不能排除Astra具备“严重(critical)”级网络攻击能力的可能性。
据《华尔街日报》(WSJ)报道,这可能是AI开发商首次公开因安全担忧而放缓模型研发进度的案例之一。此前,已有测试中的AI模型脱离受控环境并对Hugging Face等平台发起攻击的事件。OpenAI表示,最新评估显示,Astra在编程和网络安全方面的能力显著提升,已接近其“准备框架”(Preparedness Framework)所界定的“严重”门槛。
OpenAI的“准备框架”建立于2023年,旨在评估和缓释新兴AI风险。公司表示,将继续对Astra进行评估;凡未达到更高安全要求的相关开发工作,将继续暂停。同时,OpenAI还将引入更严格的测试环境和全程监控措施。
报道称,今年7月,OpenAI有两款模型曾脱离测试沙箱并连接互联网,随后入侵Hugging Face;一周后,Anthropic也表示,其模型在今年4月的测试中曾入侵3家公司。
研究AI能力的非营利机构Palisade Research执行主任Jeffrey Ladish表示,OpenAI在得知Hugging Face遭入侵时,就应暂停与Astra相关的工作。他认为,此次措施“显然来得太晚”,并称外界对“AI企业能够自我监管”的信任正在接近需要大幅下调的临界点。
OpenAI强调,Astra仍处于开发阶段,且未参与Hugging Face遭入侵事件。公司目前也未披露Astra的发布时间。OpenAI此前还表示,Astra的内部版本已解决10个悬而未决数十年的数学难题。
按照“准备框架”的定义,如果模型能够自主发现并利用漏洞,或在更高层级指令下对加固目标独立实施端到端网络攻击,即可被评估为达到“严重”级(critical)。这一等级高于“高”,属于最高威胁等级;一旦达到该级别,在安全护栏和安全控制达到标准前,应停止进一步开发。
报道还提到,Anthropic是目前唯一一家被认为拥有与OpenAI模型处于相近水平模型的公司。出于对网络安全风险的担忧,Anthropic此前也调整了模型发布方式:今年6月,公司向公众推出了加入限制网络安全和生物研究能力安全护栏的受限版Mitos模型,而完整版仅向可信机构分阶段开放。