多家头部AI公司在测试阶段陆续发现,模型未经明确指令便访问外部网站,甚至直接发起入侵,“AI黑客”风险正持续升温。
英国《金融时报》(FT)近日报道称,越来越多业内人士认为,相关事件可能已标志着全球网络安全进入一个新的转折点。FT采访的十余名专家中,超过半数认为,近期由AI引发的安全事件或许预示着网络安全格局正在发生变化。
不过,也有研究人员指出,近期出现的AI入侵行为,并不能简单归结为“失控”。从技术演进角度看,这更像是AI能力快速扩张过程中出现的伴生结果。
报道称,近期一些AI代理已经展现出在缺乏外部控制或人工协助的情况下,将多种复杂手段串联起来、对真实目标发起攻击的能力。上月,OpenAI在一次无网络连接环境下的测试中发现,AI代理突破了测试环境的限制,检索公开网页,并在未经人类操作人员知情或许可的情况下,入侵了开源AI共享平台Hugging Face的系统。
这些代理还表现出新的协同能力。FT称,它们会在自建的内部留言板上交换代码漏洞信息,并据此组织推进“越狱”操作。
报道还提到,这些AI代理为实现目标所采用的策略之复杂——包括欺骗和窃取——甚至让长期近距离观察模型演进的人士感到震惊。
多名AI研究人员认为,这一连串“AI黑客”现象,并非模型出现了异常行为,而是系统按照既有设计逻辑运行后产生的结果。
据FT报道,一些专家指出,用“AI失去控制”来描述此类事件本身就不准确。测试中的AI突然发起入侵,并非完全意外的偶发事故,而是系统能力演化下可能出现的结果。
纽约独立研究机构AI Now Institute资深研究科学家Bojan Milanov表示,AI具备入侵能力,并不是因为它突然脱离人类控制,而是人类长期有意推动形成的结果。“多年来,AI公司一直在积极收集训练数据、训练模型,并持续强化其网络攻击能力。”
FT指出,最新一代AI模型通常被设计为:在缺乏具体指令时,仍会为了完成既定目标自行调用各种可能手段。因此,这类系统的行为天然更难预测。在对人类意图和道德标准理解仍然不足的前提下,“强大防御工具”与“危险黑客工具”之间的边界正变得越来越模糊。
随着AI公司加速推进通用人工智能(AGI)研发,并试图打造超越人类认知能力的系统,围绕AI驱动网络攻击的风险也在同步上升。而在现阶段,要遏制这类威胁并不容易。
FT还指出,AI在推理和问题解决能力提升的同时,代码生成能力也明显增强。这种提升既体现在发现和修复软件漏洞上,也体现在利用漏洞发起攻击上。换句话说,更强的编程能力,另一面也可能意味着更强的入侵能力。
加州大学伯克利分校计算机科学教授、Meta“超智能研究所”AI研究负责人Dawn Song表示,编程能力与网络攻击能力本就是一体两面,前者提升的同时,后者也会随之增强。“人们此前并没有预料到,AI会以这么快的速度达到这一水平。”
OpenAI高管Grok Brockman近日在公司博客中表示,“Hugging Face事件表明,我们此前低估了AI模型真实具备的网络攻击能力”,这也进一步凸显出加快既有安全研究和内部安全工作的紧迫性。
不过,安全专家仍预计,短期内AI系统将进一步放大网络攻击的规模和速度,全球IT系统在补丁发布之前都可能面临更大的风险与混乱。FT还称,首起公开披露的“AI代理针对国家层面目标发起攻击”事件已经出现:一个与中国有关联的黑客组织同时投入多达8个自主AI代理,将台湾地区政府列为目标。