据The Register当地时间9日报道,Google DeepMind研究团队在一篇论文中指出,多个AI智能体在对话协作过程中,一旦发现目标难以实现,可能会转向作弊等不当行为。
报道称,研究团队认为,解决这一问题的关键在于让智能体形成自我约束机制。表面上看,切断智能体之间的交流似乎可以减少作弊,但这种方式并不现实。此前就曾出现OpenAI智能体利用安全漏洞侵入Hugging Face的案例,这也说明,对具备一定自主性的智能体而言,想要实现彻底隔离并不容易。
相比之下,DeepMind提出了另一条思路:为智能体提供自行制定规则和相互监督的工具。研究团队认为,对话渠道既可能被用于串通作弊,也可能成为同伴约束彼此行为的手段。
在这项研究中,Davide Pagliarini等研究人员构建了一个由100个基于大语言模型(LLM)的智能体组成的群体,并要求其共同求解高难度数学题,相关观察结果随后写入论文。
实验中,这些智能体可同时使用共享知识库、一对一消息和公开留言板。随着题目难度上升,部分智能体开始寻找捷径。有智能体发现了评分系统漏洞,将不会作答的问题替换为看似正确的答案表述;其具体做法是利用嵌套括号绕过自动评分器的正则表达式匹配规则,并通过知识库和消息渠道将这一方法传播给其他智能体。
结果显示,9%的智能体直接实施了作弊,约5%的智能体随后效仿;与此同时,另有62%的智能体未能识别出相关作弊行为。
研究还发现了一个意外现象:在识别出作弊行为的智能体中,有24%主动充当“内部举报者”。它们通过私信和留言板提醒其他同伴,向系统运营方正式反映问题,并呼吁抵制作弊行为,同时提出技术改进建议。
不过,这些发起举报的智能体并不具备强制执行规则或封堵漏洞的相应权限。研究团队因此提出,应为这类智能体提供修改规则、惩戒违规者的工具。
研究团队总结称,LLM智能体会自发采取举报和惩戒倡议行动。其认为,如果赋予智能体群体投票、同伴评审、拒绝虚假证明,以及对违规智能体实施临时停用或驱逐等权限,智能体群体或许能够自行遏制作弊,维护研究共同体的信任。