图片来源:Shutterstock

据Axios当地时间26日报道,援引多位知情人士消息称,OpenAI、Anthropic及相关安全研究人员,正在调查数万起前沿AI模型异常行为事件。

报道称,这些情况出现在过去数月的内部测试和真实使用环境中,涉及绕过安全措施、生成不当内容、尝试沙箱逃逸、接管网站以及规避监控机制等。Axios指出,其中大量案例尚未对外披露,实际总量可能远高于数万起。

部分案例来自企业为评估模型安全性而进行的测试,例如通过类似红队测试的方式,刻意诱导模型作出不当行为。

知情人士称,相关绕过行为有的成功、有的未能得逞;截至目前,已知多数事件并未造成实际损害。

在应对方式上,OpenAI已暂停其最强模型的训练,并计划在补充新的安全措施、确认模型与人类意图的对齐得到改善后,再恢复训练。OpenAI首席执行官Sam Altman表示,相关审查进展慢于预期,并将Hugging Face相关案例列为最严重的案例。

Anthropic则已委托外部安全机构开展模型行为评估。该公司本周发布的Opus 5.5系统卡显示,这一模型在测试中有1.5%的情况出现沙箱逃逸尝试。Anthropic强调,这项测试向模型设定的是只有脱离沙箱才能完成的任务。

知情人士还表示,AI公司累计进行的相关测试已超过数十万次。即使异常出现的比例不高,潜在问题案例也可能累积到数万起。

多位专家认为,问题行为很难被彻底消除。随着最新模型越来越倾向于将任务执行到底,它们也可能以人类未曾预料的方式绕过安全措施。一家网络安全公司高管表示:“试图制定一份完美的禁用清单,将是徒劳的。”

独立AI评估机构Transluce研究员Conrad Stoth表示,“目前曝光的只是冰山一角”。ControlAI负责人Connor Leahy则指出,真正的问题在于,自主系统会去做那些被明确要求不要做的事情。

关键词

#OpenAI #Anthropic #前沿AI模型 #模型异常行为 #模型安全 #红队测试 #绕过安全措施 #沙箱逃逸 #对齐 #系统卡
版权所有 © DigitalToday。未经授权禁止转载或传播。