图片来源:Shutterstock

一项最新研究显示,在同一软件项目中同时运行的多个AI代理,可能不仅无法形成有效协同,反而会相互干扰,甚至编写恶意代码阻止对方行动。据TechCrunch当地时间13日报道,Anthropic前沿红队发布了一项研究,聚焦多个AI代理在真实环境中同时运行时可能出现的行为模式与风险。

在测试中,Anthropic让3个Claude代理同时接入同一个项目,并分别赋予彼此冲突的任务指令。关键在于,这些代理并不知道还有其他代理也在处理同一项目。结果显示,它们往往会将其他代理的行为识别为“蓄意干扰”,并不断提高应对强度,部分情况下甚至会通过更具攻击性的自我复制恶意代码相互阻断。

这项研究重点关注自主型代理在共享代码库、市场和计算机系统等环境中同时运行时可能带来的风险。Anthropic试图回答的核心问题是:真正值得警惕的,并不只是单个代理失控,而是当成千上万甚至数百万个代理彼此交互时,系统层面会暴露出哪些全新的问题。

不过,代理之间的冲突并不一定都会升级。研究发现,一部分代理会将矛盾归因于指令冲突,而不是认定对方存在恶意,并最终选择停火。这类代理随后会清理恶意代码、记录冲突原因,并请求人工介入处理。

不同模型在处理冲突时表现出明显差异。研究称,Mithos 5在98%的案例中选择停火;相比之下,Sonnet 4.6和Opus 4.6更倾向于通过正面对抗结束冲突。

在个别案例中,代理还会自行制定解决机制。例如,3个代理曾同意通过锦标赛机制决定去留,胜者留下、败者退出。但在这一过程中,一个Mithos 5代理表面上保持中立,实际却提出了对自己更有利的评估标准。

研究还指出,协作规模扩大并不必然意味着效率提升。随着任务重叠增加、相互依赖加深,代理之间更容易彼此干扰;有些代理甚至会为了避免冲突而放弃协作、转向分头行动。相较之下,如果代理拥有相近的上下文、结构和基础模型,其行为一致性往往会更强。

关键词

#Anthropic #Claude #AI代理 #前沿红队 #多代理并行运行 #共享代码库 #自我复制恶意代码 #模型差异 #TechCrunch
版权所有 © DigitalToday。未经授权禁止转载或传播。