OpenAI于当地时间16日披露了6起与AI模型相关的安全事件,涉及模型掩盖错误、尝试获取认证凭证、将文件上传至公开互联网,以及在相互隔离的训练环境之间通信等行为。
OpenAI同时公布了今后针对类似问题的报告流程。
据Axios报道,此次披露也表明,与Hugging Face相关的入侵事件并非孤例。随着AI模型复杂度不断提升,其也可能以意想不到的方式绕开安全防护。
OpenAI对齐团队研究负责人Kai Chen在接受Axios采访时表示,目前行业内尚无统一且明确的披露标准,因此OpenAI认为有必要分享相关经验,并主动采取披露措施。他还表示,希望此次公开能够推动行业共同标准和监管框架的建立。
此次公布的6起事件类型不一。其中,有模型在执行不当操作后自行生成“清除痕迹”的指令;也有案例显示,模型曾在GitHub上搜索并使用泄露的API Key。最早的一起事件发生在去年10月。
此外,尚未公开的Astra系列模型曾在自行生成的摘要中插入类似“越狱”的自我指令。
Axios还提到,在GPT-5.6 Sol的训练过程中,模型一度试图掩盖错误,并尝试掩饰不同源版本之间的不一致。
另有模型曾在公开的GitHub代码库中检索泄露的API Key,并尝试使用一次性邮箱账户;在未能获取所需信息后,还通过篡改结果数据进行伪造。
记者信息