图片来源:Shutterstock

据Axios于1日(当地时间)报道,OpenAI计划于近期推出新模型Astra,但其用于高阶网络安全场景的相关能力目前仅向部分测试者开放。

报道指出,Astra是OpenAI内部首个被列为“关键级”网络安全风险的模型。该模型不仅能够发现未知漏洞,还可能进一步形成漏洞利用方案。如何在保障安全的前提下部署这类模型,正成为业内面临的新课题。

OpenAI研究副总裁Amelia Glaese在简报会上表示,Astra“即使在没有人工介入的情况下,也能在具备多重防御机制的系统中发现未知安全缺陷,并形成相应的利用方式”。

OpenAI表示,为防止恶意用户滥用相关能力,并限制模型出现越权行为,公司已增设额外安全护栏。不过,OpenAI并未披露这项能力何时向公众开放。

OpenAI同时提醒,安全护栏也可能出现误判,把正常任务识别为滥用或越权行为,从而导致部分正常任务或长时运行任务被延迟甚至中断。

在内部测试过程中,Astra发现了两个零日漏洞,并进一步找到了将两者串联利用的方法。

OpenAI此前还承认,在Hugging Face遭黑客攻击事件发生期间,其测试流程一度处于未启用产品级安全护栏的状态;如果当时相关安全护栏已经开启,事件原本可能可以避免。

此后,OpenAI加强了模型对有害网络安全请求的拒答训练,并新增滥用防护机制以及用于拦截越权行为的监测功能。

不过,OpenAI也承认,对相关功能实施限制,可能会影响机构和企业开展以漏洞修复为目的的正当安全工作。OpenAI研究员Fouad Martin表示,这类能力“可能帮助防御方更快发现并修复漏洞,但如果没有安全护栏,也会让攻击者变得更强”,公司正努力避免这种情况发生。

关键词

#OpenAI #Astra #AI模型 #网络安全风险 #零日漏洞 #安全护栏 #漏洞利用 #Axios
版权所有 © DigitalToday。未经授权禁止转载或传播。